从事分子生物学研究工作, 当拿到一段未知的DNA或者RNA序列之后, 最为急切想要知晓的便是它于数据库中是否存在“亲属”关系。用来解决这一问题的密钥是BLAST工具, 该工具借助比对算法, 助力我们于海量的GenBank数据里快速定位相似序列, 进而推断基因功能或者进化关系。很多新手面对繁杂的参数设置常常会感到头疼不已, 实际上只要掌握核心逻辑, 便能够高效完成同源性分析。
怎么选择正确的BLAST程序和数据库
存在不少人, 在起始的第一步, 便错误地挑选了工具, 进而致使结果全然无法得以使用。核酸序列展开分析之时, 需要明白区分究竟是处于核苷酸的水平, 还是处于蛋白质的水平。要是你手中所拥有的是原始的测序结果, 诸如Sanger测序峰图或者NG短读长这样的, 那就应该运用tblastn或者blastn。前者它是把查询序列进行蛋白翻译以后用以对外核酸库进行比对, 这适合用来谋求远缘同源基因;后者则是直接去比对核苷酸, 这适合种内或者跟近缘物种去进行精确的比对。
关键同样在于数据库的选择, nr数据库涵盖了所有非冗余的公共核酸序列, 覆盖面广然而噪音也大。若为注释新基因, 建议结合RefSeq数据库, 其序列经过人工审阅, 质量更高。对于特定物种的研究, 选择对应的taxon ID限制范围, 能大幅减少无关结果的干扰, 使搜索结果更聚焦于目标生物。获得可靠同源性证据的前提是精准匹配。
如何解读E值和Identity看结果靠谱吗
程序跑完后生成的那份报告当中, 有好多数字, 看得人眼睛都花了。这里面, E-value也就是期望值, 它被视作是最为关键的指标。该数值表明, 在随机性的状况里边, 出现那种比对的概率究竟是多少。E值越小, 意味着匹配愈发显著。一般来讲, 只有小于1e-5, 才会被当成具备统计学的意思。要是E值恰好是0.0, 那就绝对是堪称完美的匹配。
在考量时, E值之外,Identity即相似度百分比, 以及Query Coverage也就是覆盖度, 这二者同样不容忽视。在有些时候, 存在这样的情况, 两个序列之间的相似度竟然高达99%, 然而, 如果其覆盖度仅仅只有10%, 这般状况下, 那很有可能仅仅只是某个保守结构域出现了偶然的匹配现象, 并不具备生物学方面的意义。而所谓理想的同源序列, 应当是具备高相似度的同时, 还拥有高覆盖度才对。和Bit Score(比特分)一块儿进行查看, 分数处于越高的状态, 比对时所呈现出的质量便会越好。把这些指标全面综合起来, 才能够判定所找到的“亲戚”是不是确实与你所研究的问题存在相关性, 以此来防止被假阳性所误导。

