Key points are not available for this paper at this time.
之前的研究表明,利用合适的统计背景模型识别和分析基因组序列中丰度和稀有的k-mer或"长度为k的DNA词"可以揭示生物学上重要的序列元素。其他研究调查了不同DNA序列中k-mer丰度的单峰/多峰分布或"k-mer光谱"。然而,现有的背景模型受到组成偏差的不同程度影响。此外,k-mer丰度在相关基因组中的分布之前尚未研究。在这里,我们提出了一种新的统计背景模型,用于基于每个k-mer的两个(k-1) mer的频率平均值计算DNA序列中的k-mer富集。我们的方法与包括不同阶数的马尔可夫模型和单一不匹配模型在内的常用模型的比较显示,我们的方法对AT富集组成偏差更具鲁棒性,并且能够检测到许多额外的、重复贫乏且生物学意义重大的过度丰度k-mer。使用该模型分析来自四种酵母物种的过度表现的基因组k-mer(4≤k≤16)显示,过度表现的DNA词的比例随k的增加而线性下降;然而,高k值存在大量的过度丰度k-mer。最后,对四种酵母物种中k-mer丰度评分的比较分析揭示了所分析的各种基因组子区域的单峰和多峰光谱的混合。
Hariharan等人(周二)研究了这个问题。