Key points are not available for this paper at this time.
粗粒化(CG)模型通过将多个原子分组为有效粒子来简化分子表征,与全原子方法相比,能够实现更快的模拟并缩减化合物空间。此外,具有化学特异性的模型(例如 Martini)可以外推至实验数据匮乏的情况,使得 CG 方法在高通量(HT)筛选和化学空间探索中极具前景。然而,目前在描述原子如何分组(即映射)这一关键环节上尚无严格的数据格式。随着 CG 模型向真正的 HT 能力迈进,针对日益增加的 CG 分子缺乏映射和索引能力成为了重大障碍。为了解决这一问题,我们引入了 CGsmiles,这是一种受广泛应用的简化分子线性输入系统(SMILES)和 BigSMILES 启发的通用线性表示法。CGsmiles 独立于分辨率对分子图和粒子(原子)性质进行编码,并包含一个支持在粗粒度和细粒度分辨率之间无缝转换的框架。通过指定描述每个粒子在下一级更精细分辨率下如何表示(例如从 CG 粒子到原子)的片段,CGsmiles 可以在单个字符串中表示多种分辨率及其层级关系。在本文中,我们介绍了 CGSmiles 语法,并分析了来自 Martini 力场的 407 个分子的基准数据集。我们重点阐述了现有表示法中缺失的、对于精确描述 CG 模型至关重要的关键特征。为了展示 CGsmiles 在模拟之外的应用价值,我们构建了两个用于预测分配系数的简易机器学习模型,二者均在经 CGsmiles 索引的数据上进行训练,并同时利用了来自 CG 和全原子分辨率的信息。最后,我们简要讨论了 CGsmiles 在聚合物中的适用性,聚合物尤其受益于该表示法的多分辨率特性。
Grünewald et al. (Mon,) 研究了这一问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: