Key points are not available for this paper at this time.
错义变体的解释仍然是临床基因组学中的一个主要挑战。错义致病性预测器表现出色,但许多强调蛋白质水平的后果或重叠的注释先验。基因组语言模型是否在错义解释中增加了不冗余的核苷酸背景信号仍不清楚。在这里,我们系统地调整了基因组语言模型,以适应 ClinVar 错义致病性预测,涉及骨干架构、表示策略、分类器头和适应机制。在我们的分析中,变体位置嵌入始终优于汇集的序列表示,多物种预训练提供了最强的骨干级优势,而低秩适应的泛化能力优于全面微调。结果得到的精细调优模型 GLM-Missense 在同一预训练模型的零样本评分中表现得明显更好。为了测试 GLM-Missense 是否提供了超越现有方法的信息,我们构建了 MetaMissense,这是一个将 GLM-Missense 与 AlphaMissense、ESM1b、REVEL、CADD、SIFT 和 PolyPhen-2 结合的 XGBoost 集成模型。GLM-Missense 与其他预测器的最低一致性,在控制其他预测器后仍保留了与致病性的最强部分关联,并在 MetaMissense 中排名为信息量最丰富的非集成输入。MetaMissense 在交叉验证和保留测试中表现最佳。对被 GLM-Missense 正确分类但被几个已建立的预测器错误分类的变体的分析显示了两种模式。首先,部分 GLM-Missense 信号可能反映拼接相关的外显子背景。其次,GLM-Missense 在其他预测器可能过度关注等位基因频率、基因级约束或氨基酸变化严重度的情况下似乎增加了价值。然而,这些特征仅解释了 GLM-Missense 正确子集与背景之间区别的约 10%。总的来说,我们的结果表明,精细调优的基因组语言模型为错义变体解释提供了互补的核苷酸背景信息.
苏等 (Mon,) 研究了这个问题。