核心方法:如何用NCBI和BLAST做核酸序列同源性分析

进行基因研究或者开展分子生物学实验, 当拿到一段不晓得的DNA或者RNA序列之后, 最为让人头疼的便是不清楚它究竟是什么。好多人对着繁杂的数据库界面迷茫, 实际上核心逻辑挺简单, 就是寻觅“亲戚”。由NCBI所提供的最强有力的工具便是BLAST(即Basic Local Alignment Search Tool), 它能够协助你去将这段陌生的序列跟源自全球范围内的数量可谓海量的序列实施比对操作, 进而寻觅出那些相似度是最为高的部分, 凭借此得以推断出它所具备的功能、源头或者进化方面的关系。这可不单单是科研领域的基础操作行为, 还是用于确诊病原体、鉴定物种的关键重要步骤。一旦理解了这个有着一定程序和环节的过程了, 你便得以掌控住打开基因组数据之宝库的第一把具有开启作用的钥匙。

序列的同源性比对软件_核酸序列同源性高达80%_基于ncbi/blast软件的核酸序列同源性分析

怎么在NCBI里找到BLAST工具并选择合适模式

序列的同源性比对软件_基于ncbi/blast软件的核酸序列同源性分析_核酸序列同源性高达80%

进到NCBI官网里头, 顶部那儿的导航栏当中, “BLAST”的入口特别醒目显眼, 点进去之后你就会瞧见一连串的选项。在这儿, 最容易致使人们产生混淆的便是数据库的挑选以及算法的不同差异。要是你手上拿着的是一段核苷酸序列, 想要瞧瞧它跟谁是相类似的, 向来首选的是nucleotide blast。如果你留意到,自身的序列属于编码区基于ncbi/blast软件的核酸序列同源性分析, 而你期望直接查看其翻译后蛋白质的匹配状况, 运用blastx通常能够给出更为精确的功能注释结果, 这是由于蛋白质序列相较于核酸序列而言, 更为保守, 变异次数更少。挑选适宜的比对策略, 可使你的搜索结果由“大海捞针”态势转变为“精准定位”状况。千万别一开始就进行全库搜索, 不然不但速度缓慢, 当中噪音还众多。对于特定的物种, 或者针对特定的基因家族, 能够对数据库范围予以限制, 比如说仅仅查询RefSeq RNA, 又或者是特定的分类单元Taxonomy, 如此这般得出的结果才具备实际参考价值。

如何解读BLAST结果中的关键指标

序列的同源性比对软件_基于ncbi/blast软件的核酸序列同源性分析_核酸序列同源性高达80%

结果跑出来之后, 新手面对那一堆数据, 通常仅仅只看第一行。实际上, 真正起着决定可信度作用的是几个核心参数。E-value也就是期望值, 是最为关键紧要的指标, 它指的是随机匹配产生出该分数的概率。E值越小, 表明匹配越显著突出的特性, 越不太可能是偶然才发生的情况。一般都认为E值小于1e - 50才算是高度可靠的, 如果大于1, 大体上就能够忽略不计。除此以外, Query Cover也就是查询覆盖率同样是相当重要的, 要是覆盖的程度很低, 哪怕得分是高的, 也极有可能仅仅只是某一个保守结构域的片段匹配, 而并非全长同源。Identity即相似度百分比直观地展现了序列的一致程度。把这三者结合在一起, 你才能够判断这段序列究竟是不是真正属于你预期的基因。有时候,高相似度也许来源于重复序列或者污染基于ncbi/blast软件的核酸序列同源性分析, 在这个时候就需要认真仔细地去检查比对图也就是Graphics Summary, 查看是不是存在断裂或者不连续的匹配区域, 以此来避免被假阳性所误导。

地址: 杭州市钱塘区下沙街道和骥研发中心1幢5层511室 电话:0571-89898229