在科研工作里,构建与美化进化树是必须掌握的技能之一。这篇文章汇总和整理了之前的相关内容,依照文章中的脉络,基本上能够在大多数情形下满足构建进化树的需求。本文将从测序数据到构建系统发育树需要经过这4个步骤进行阐述:①数据收集与预处理②多序列比对③选择适合的建树方法④系统发育树的评估与美化。
数据准备与预处理
数据收集与预处理是基因组测序数据分析的关键步骤,主要包括去除低质量序列、去除接头序列、过滤污染序列等,以提高数据的整体质量。
在构建系统发育树之前,首先需要从海量的生物信息数据中挑选出适合的分子序列。常见的分子序列包括DNA序列和蛋白质序列。
选择分子序列时,首先要明确研究目的。若想探究物种间大框架的亲缘关系,那就选保守性高的基因序列,比如 16S rRNA 基因,在原核生物系统发育研究中就经常会用到。要是关注物种近期的进化,或者种群动态,那就选变异性高的基因或者非编码区序列。同时,还得考虑物种特性。在植物研究中,叶绿体基因相对保守,非常适合用来分析植物类群的系统发育。而在动物研究里,线粒体基因进化速率快,常用于动物种群层面的研究。
• 注意事项:
• 确保所选序列的质量,避免包含过多噪声或错误。






多序列比对是构建系统发育树的关键步骤之一,通过比对不同物种的分子序列,找出它们之间的相似性和差异性。常用的多序列比对软件包括:
Clustal 老牌软件,操作简单,适合小数据集。基于渐进比对的多序列比对工具,有适用于多种操作平台的版本,如ClustalW和ClustalX。ClustalW速度较慢,但比对结果较为可靠。
MAFFT 针对大数据集(超千条,万条以上序列)的多序列比对软件。处理大量序列时表现出色,速度快,功能强大,能快速处理复杂的任务。如果你不会命令行操作,觉得在本地安装和配置MAFF太麻烦,可以在Galaxy生信云平台上(usegalaxy.cn)运行它来进行多序列比对。
了解详情请参考文章:多序列比对工具,我曾经最爱这一款

Muscle 平衡了速度和准确性,适合中等规模的数据集。其在速度和精度上都优于ClustalW,尤其是在处理一些长度适中,但是有部分序列相似性不是很高的情况。你还可以在Galaxy生信云平台上(usegalaxy.cn)一键运行Muscle来快速进行多序列比对,无需任何安装及配置。
了解详情请参考文章:细菌全基因组序列怎么构建系统进化树啊:详细思路解读,一文掌握

BLAST 最常用的短序列比对工具,支持核酸和蛋白的双序列比对,还可以在数据库中寻找相似序列。BLAST功能强大,但分析速度较慢,结果不够直观。
BLAT 适用于寻找高相似度的序列,对于DNA序列,要求95%及以上相似且至少25个碱基;对于蛋白序列,要求80%及以上相似且至少20个氨基酸。BLAT在远亲缘物种间的比对精度不够高。
DNAMAN 简单常用的核酸序列和蛋白质序列分析软件,支持多序列比对、序列同源性分析等多种功能,界面友好,占用内存小。
选软件的时候,如果序列数量少、长度短,Clustal 系列就行,操作简单且结果好。如果数据集非常大,比如说要对整个基因组中的很多基因进行比对,那可能Clustal Omega或者MAFFT更合适。如果是中等规模,而且希望比对结果比较精确,MUSCLE是个不错的选择。序列相似性高的话,多数软件都能适用;要是相似性低,MAFFT 和 MUSCLE 适应性更好。另外,如果计算资源充足且是多核处理器,Clustal Omega 和 MAFFT 能利用并行计算,速度更快;要是计算资源有限,MUSCLE 也能应对。
构建系统发育树的方法多种多样,选择合适的方法对于获得可靠的分析结果至关重要。常用的建树方法包括:
最大似然法(ML)
通过建立进化模型,利用统计模型估计各个分类单位之间的进化距离和树的拓扑结构,选择最大似然值最高的系统树作为最佳解。ML法对数据的要求比较高,适合大数据,适用于有合适分子进化模型的情况,尤其适合远缘物种序列。


FastTree


我们可以根据自己的需求和喜好等因素去考量,选最适合自己的那个就是最好的。对于大规模数据集,FastTree和IQTREE是较好的选择;而对于需要高精度结果的研究,则可以选择RaxML或PHYML。
距离法(NJ) 通过测量各个分类单位之间的距离,构建进化距离矩阵,再通过层次聚类等方法构建系统树。常用的距离法有UPGMA和Neighbor-Joining(NJ)等。NJ法适用于近缘物种序列,但对于相似度很低的序列可能会出现长枝吸引(LBA)现象。
贝叶斯推理法(BI) 通过建立贝叶斯统计模型,利用贝叶斯推理计算出各个分类单位之间的进化关系和树的拓扑结构概率分布,选择概率最高的系统树作为最佳解。贝叶斯法通常能获得比ML法更准确的结果,但计算量较大。
最大简约法(MP)
通过比较各个分类单位之间的特征相似性,选择具有最少进化步骤的系统树作为最佳解。适用于数据较少或计算资源有限的情况。
选择建树方法时,需要根据数据的特性和分析目的来决定。如果数据量很大,ML或者BI可能更适合,不过ML要注意参数调整,BI则需要更多的计算资源。如果是小数据集,MP是个不错的选择。如果序列之间的进化距离比较小,距离法(如NJ)可以快速得到结果。当然,目前最受欢迎的当属最大似然法的几款工具。
构建完系统发育树后,需要对树进行评估,以确保其准确性和可靠性。常用的评估方法包括:
为了使系统发育树更加直观和美观,可以使用一些进化树美化工具。常用的工具包括:
结语
构建系统发育树需要从选择合适的分子序列开始,通过多序列比对确保序列的同源性,选择合适的建树方法构建树,并通过评估确保树的可靠性。使用进化树美化工具可以提升树的可读性和展示效果。每个步骤都有其特定的注意事项,确保数据的准确性和分析的可靠性。希望这篇文章能帮助大家更好地理解和应用这些步骤,如果有任何问题,欢迎在评论区留言讨论!