Key points are not available for this paper at this time.
大型语言模型训练于巨大的生物序列语料库,是下游基因组和蛋白质组任务的最先进技术。由于基因组包含编码所有蛋白质的信息,基因组语言模型(gLMs)有潜力对DNA序列和蛋白质进行下游预测。然而,由于很少有任务将蛋白质与可由gLMs处理的编码DNA序列(CDS)配对,因此gLMs在蛋白质任务上的表现仍不明确。在本研究中,我们策划了五个这样的数据集,并用它们评估了gLMs和蛋白质语言模型(pLMs)的性能。我们证明gLMs在某些任务中具有竞争力,甚至超越了pLMs。使用检索的CDS所获得的最佳性能优于抽样策略。我们发现,训练联合的基因组-蛋白质模型的表现优于每种单独的方法,显示它们捕捉到不同但互补的序列表示,我们通过对它们的嵌入模型解释展示这一点。最后,我们探索了不同的基因组分词方案,以提高下游蛋白质的表现。我们训练了一个新的核苷酸变换器(50M)基础模型,其3mer分词在蛋白质任务上超过了6mer对手,同时在基因组任务上的表现保持不变。将gLMs应用于蛋白质组学提供了利用丰富的CDS数据的潜力,并且在中央教条的精神下,有可能实现基因组学和蛋白质组学的统一和协同方法。我们提供了我们的推断代码、模型权重和数据集。
Boshar 等人(周三)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: