Key points are not available for this paper at this time.
由于分子复杂性错综复杂,构建适当的表示对于分子预测仍然至关重要。此外,生成用于分子科学中监督学习的标注数据往往成本高昂并受伦理限制,导致小而多样的数据集。在本研究中,我们开发了一种自监督学习方法,从多个数据库中超过7亿个未标记的分子中预训练模型。从这种方法中学到的内在化学逻辑使得能够在微调过程中从特定任务的分子序列中提取预测表示。为了理解从未标记分子中自监督学习的重要性,我们组合了三种具有不同数据库组合的模型。此外,我们提出了一种基于数据特征的协议,以自动选择特定任务的最佳模型。为了验证所提议的方法,我们考虑了10个基准和38个虚拟筛选数据集。广泛的验证表明,所提议的方法表现优异。
Chen et al. (Mon,) 研究了这个问题。