Key points are not available for this paper at this time.
基于单倍型的统计方法广泛用于寻找处于正向选择下的基因组区域。这些统计方法的核心是计算扩展单倍型均匀性(EHH),它捕捉从焦点位点向外的均匀性衰减。这一计算在潜在数百万个位点上重复进行,计算需求很高,因为它涉及在很长的基因组距离和许多个体之间迭代跟踪独特单倍型的计数。由于这些计算挑战,现有工具在应用于大规模人口数据集(如1000个基因组项目或50万个个体的英国生物银行)时并不具备良好的扩展性。当数据集增大时,优化计算变得至关重要,尤其是在处理大样本量或者生成机器学习算法的训练数据时。在这里,我们提出了一种动态编程算法,显著提高了在实际和模拟数据上的运行时间和内存使用。对于实际相位数据,我们实现了5-50倍的加速,且内存占用极少。我们的模拟显示,在大规模人群中,性能差距更为明显(最高可达15倍加速和46倍内存减少)。针对未相位基因型设计的基于EHH的统计方法运行速度快了一个数量级,多参数支持则使运行时间提高了20倍。源代码和二进制文件可在 https://github.com/szpiech/selscan 获取,版本为selscan v2.1.
Rahman等人(周五)研究了这个问题。