Key points are not available for this paper at this time.
在指数增长的分子数据库背景下,组装大型多基因数据集用于系统基因组学研究变得越来越容易。由于采样(随机)误差的减少,预计分辨率的提高已成为现实。然而,系统性偏差的影响也将变得更加明显,甚至可能占主导地位。我们选择研究长分支吸引伪影(LBA)的案例,使用真实序列而非模拟序列。选择了两条快速进化的真核生物谱系,微孢子虫和隐藻核体,它们的进化位置已得到良好确立,作为模型物种。组装了一个大型数据集(44个物种,133个基因和24,294个氨基酸位置),尽管使用了基于最大似然的树重建方法和复杂的序列进化模型,但所得到的有根真核生物系统树仍然因LBA伪影而被误导。当逐步去除快速谱系中的快速进化蛋白(最多90%)时,明显伪影基底位置的自助支持下降到几乎0%,而相反,仅有的预期位置,所有快速进化物种可能位置中的一个,获得的支持逐渐增加,最终收敛到100%。去除快速进化蛋白的百分比构成了系统发育推断对LBA敏感性的可靠估计。该协议确认丰富的物种取样(尤其是与快速进化谱系密切相关的物种的存在)以及复杂模型的概率方法对于克服LBA伪影的重要性。最后,我们观察到,系统发育推断方法在模拟数据上表现显著优于真实数据,并建议在模拟数据上测试系统发育推断方法的可靠性会导致对其性能的过度自信。尽管系统基因组学研究可能受到系统性偏差的影响,但丢弃大部分包含非系统发育信号的数据的可能性允许恢复一个受到系统偏差影响较小的系统树,同时保持高统计支持。
Brinkmann等人(Sat,)研究了这个问题。