
重复序列注释我两年前做过一次,这次用同样的软件,还是出了很多问题,折腾了快一个月,现在的结果才算说的过去,这里总结一下这一阶段遇到的问题。
Repeatmasker
不同的重复序列数据库对重复序列注释的结果有很大的影响。repbase是收费的,但是会注释出相对更全的重复序列。
CONS-Dfam_3.0数据库:
RepeatMasker version open-4.0.9
Search Engine: NCBI/RMBLAST [ 2.9.0+ ]
Master RepeatMasker Database: Libraries/RepeatMaskerLib.embl ( Complete Database: CONS-Dfam_3.0 )只注释出4.5%的重复序列:
sequences: 7920
total length: 1542690326 bp (1542658026 bp excl N/X-runs)
GC level: 38.48 %
bases masked: 69381223 bp ( 4.50 %)dc20170127-rb20170127数据库:
RepeatMasker version open-4.0.7
Search Engine: NCBI/RMBLAST [ 2.6.0+ ]
Master RepeatMasker Database: Libraries/RepeatMaskerLib.embl ( Complete Database: dc20170127-rb20170127 )注释出了10.48%的重复序列:
sequences: 7920
total length: 1542690326 bp (1542658026 bp excl N/X-runs)
GC level: 38.48 %
bases masked: 161682862 bp ( 10.48 %)
由于repbase需要花钱订购,因此我第一次就用了免费自带的Dfam数据库。这个数据库对于一些模式动物,植物或者其近缘物种,热门物种等的重复序列注释,应该是够用了,但是像我这种研究比较少的软体动物基因组,单用Dfam与用repbase还是有很大的区别。然而,尽管提升了很多,但相比于预测出的~60%的重复序列,说明还有相当多的重复序列没有注释出来。
Repeatmodeler
简单来说,Repeatmasker 基于与已知的重复序列数据库比对来寻找重复序列,Repeatmodeler是通过重续序列的结构特征来进行从头注释,因此可以寻找一些物种特有的重复序列。
输出结果的问题:
官方文件中,对于软件的最终结果是这样描述的:
At the succesful completion of a run, two files are generated:
<database_name>-families.fa : Consensus sequences
<database_name>-families.stk : Seed alignments我的log文件显示已经跑完了(我截取了后面几行),并且表明结果是以families.fa 与 families.stk为后缀的文件:
RepeatClassifier Version 2.0.1
======================================
Search Engine = rmblast
- Looking for Simple and Low Complexity sequences..
- Looking for similarity to known repeat proteins..
- Looking for similarity to known repeat consensi..
Classification Time: 00:34:35 (hh:mm:ss) Elapsed Time
Program Time: 24:38:26 (hh:mm:ss) Elapsed Time
Working directory: /truba/home/odogan/03.Arion/02.annotation/01.repeats/03.repeatmodoler/RM_105354.ThuApr21855512020
may be deleted unless there were problems with the run.
The results have been saved to:
arionVulgaris-families.fa - Consensus sequences for each family identified.
arionVulgaris-families.stk - Seed alignments for each family identified.
The RepeatModeler stockholm file is formatted so that it can
easily be submitted to the Dfam database. Please consider contributing
curated families to this open database and be a part of this growing
community resource. For more information contact help@dfam.org.然而我的目录下面并没有这两个文件,只有两个相同格式的文件,consensi.fa, tmpConsensi.fa:
consensi.fa round-1 round-4 tmpBlastXResults.out tmpConsensi.fa.masked
families.stk round-2 round-5 tmpBlastXResults.out.bxsummary
LTR_107166.SatMay230731142020 round-3 round-6 tmpConsensi.fa从生成时间上看,tmpConsensi.fa要晚于consensi.fa,从内容上看,tmpConsensi.fa比consensi.fa多了一个fasta序列,除了序列名称有细小的差别,也没有什么不同。
我试着用这两条序列都跑过后续的repeatmask流程,但是结果中全是大量的未知序列,比例也占得非常高(Unclassified占基因组的65.17 %,其他SINE,LINE,LTR等都为0)。
这个结果很明显就是repeatmodeler没有跑完。我找到了最后一步,RepeatClassifier,然后重新跑了命令:
epeatClassifier -consensi consensi.fa这一步的输出文件应该是 consensi.fa.classified,这个文件就应该是相当于官方文件中所说的arionVulgaris-families.fa,也就是之后repeatmasker要用到的。
但是尽管我单独跑,也没有报错,但除了得到以tmp为前缀的文件,也没有得到应该有的输出文件,这个问题直到我换了一个服务器才解决。
用consensi.fa.classified注释出的重复序列正常了许多:

RepeatModeler 之后的 Repeatmasker 运行时,不同的数据库有影响吗?
结果表明数据库更全面的话,最终denovo注释出的重复序列是偏少的。但从比例上来说,相差不是很大,相差比较大的小类为LINE,DNA elements,以及unclassified.

小结:
- repeatmasker 在条件允许的条件下,用最新最全的数据库。
- repeatmodeler 的生成文件,及后续repeatmasker的输出文件应该为consensi.fa.classified, 不要去找-families.fa,也不要用中间文件consensi.fa。
- 在denovo重复序列注释时,数据库对于最终结果影响不是非常大,数据库相对比较完整时,denovo找到的比例会稍微低一些。
下一篇来总结一下比较并集成了各个重复序列注释软件的EDTA:

2020.06.11