实施分子生物学实验, 于获取测序结果后, 首要步骤常常是进行比对。众多人面对NCBI界面感到困惑, 不明白参数该怎么去调整, 也不清楚那些e值究竟代表着何种意义。实际上核心逻辑颇为简单: 即为寻找相似之处。借助BLAST软件, 我们能够迅速确定一段无从知晓的核酸序列在已知数据库里的位置, 进而对其功能或者进化关系予以推断预测。这并非神秘莫测之事, 而是依据统计学以及生物信息学问而形成的标准流程。只要领悟熟悉几个关键要点,便能够规避诸多低级错误, 使数据表达讲述更为准确精确。
BLAST核酸比对参数怎么选才准
第一步是挑选、择取出正确的BLAST程序。要是针对蛋白质编码基因, 那就运用blastx;若要直接比对核苷酸, 便采用blastn。好多人惯于使用默认设置, 然而在复杂基因组环境里, 这样做极易出现差错。举例来讲, 一经序列较短或者存在大量重复这种状况时, 默认的参数极有可能会遗漏掉关键匹配项或者产生大量假阳性结果。在这个时候应当对期望值E-value作出调整, 一般设置为1e - 5或者更小些, 以此来过滤随机匹配情况。
对矩阵而论, 其选择也是相当关键的。就亲缘关系比较远的物种来讲, 或许需要运用更为敏感的算法, 或者对罚分矩阵加以调整。一定不要盲目地信赖“默认即为最优”这种说法。在着手分析非模式生物之际, 建议先去构建本地数据库, 如此一来能够排除掉那些无关序列所带来的干扰, 进而提高比对时的特异性。
Query Coverage即覆盖度, 这也是需要予以关注的。仅仅一味关注最高分是不行的, 因为倘若覆盖的仅仅只是序列当中的极小一部分, 即便分数是很高的那种情况, 生物学所具备的意义也可能是相当有限的。要想得出可以信赖的同源性结论, 就得保证查询序列跟数据库序列之间存在着足够长的重叠区域。
如何解读BLAST结果里的陷阱
当跑出结果之后, 面对那长长的列表, 新手常常仅仅只看Top 1, 这样做是比较容易坠入陷阱的, 有时候Top 1只不过是一段虚假的基因片段, 要么就是一个注释存在错误的序列罢了, 必须要小心翼翼细查看每个结果的各自不同描述、相应评分以及比对图, 留意观察是不是存在因移码突变或者插入缺失而致使的比对中断情况, 这些有可能预示着真实存在的生物学变异现象, 而并非单纯的极其简单的测序错误。
定义同源性并非只是序列相似, 功能同源性要有更严格证据支撑, 若两序列相似度高但所属物种差异大, 得考虑水平基因转移可能性, 反之, 若相似度低但结构域保守, 也可能是远缘同源, 别仅依百分比下结论, 结合系统发育树分析更稳妥。
千万不要忘掉要手动去检查比对那些细节, 点击“Alignment”去查看下具体的碱基对应情形, 有些看起来好像完美的比对, 实际上在关键位点是存在错位的, 要仔细去审查这些细微的地方, 往往能够发现被自动算法给忽略掉的重要线索, 进而提升研究的严谨性。
