摘要 低复杂度区域(LCRs)是组成上偏向于特定类型的蛋白段,在分子识别、结构灵活性和相分离中起着关键作用。然而,由于计算工具之间的方法变异,其精确检测仍然具有挑战性。在本研究中,我们在 Homo sapiens 蛋白组中对八种广泛使用的 LCR 检测方法(在多个参数设置下)进行了综合基准测试。开发了一个模块化的计算框架,以系统性地比较 LCR 特征,包括残基中心分析(如长度分布和覆盖百分比)。蛋白质中心分析包括组成偏差、氨基酸组成和香农熵。共识分析显示,多个工具检测到的区域通常更长、更具重复性,并且组成上更纯净,建议其具有更强的结构或功能相关性。Jaccard 相似度矩阵揭示了基于共享检测原则的算法之间明显的聚类模式。此外,熵和纯度分析突显了每个工具所捕获的序列复杂性的根本差异。这些结果共同提供了一个统一、可重复的框架,用于评估 LCR 检测性能,并为在蛋白质组规模研究中可靠地注释低复杂度区域提供了实用指导。
Chatterjee 等人(周三)研究了这个问题。