Key points are not available for this paper at this time.
背景 早产(PTB,妊娠37周)仍然是全球新生儿发病率和死亡率的主要原因,而西班牙裔/拉丁裔人群在基于微生物组的研究中明显不足,特别是在密集的数据分析场景中。方法 我们应用泄漏意识的机器学习作为描述性分析框架,以表征与43名怀孕的墨西哥女性(110个纵向样本,14例早产)相关的临床和阴道微生物组模式,这些女性来自墨西哥城的公共医院。使用中心对数比变换分析阴道微生物组特征(属水平16S rRNA V3-V4序列)。我们评估了12种模型配置,代表两种算法(随机森林,弹性网)、三种临床特征选择策略(最小DREAM风格调整、基于文献的综合特征、数据驱动的经验选择)和两种微生物组表示(ANCOM-BC2差异丰度分类、完全过滤的特征)的组合。随机森林和弹性网模型在严格的受试者级别嵌套交叉验证设计中实施,以防止数据泄漏。模型区分指标被解释为内部队列结构的指标,而不是临床预测性能的估计。使用ANCOM-BC2进行差异丰度分析,以评估特征稳健性,既在全局范围内也在交叉验证折叠内进行。结果 表现最佳的描述性模型(随机森林,采用数据驱动的特征选择和完整的微生物组)展现出AUROC为0.813 ± 0.110 ,与队列内结构化临床-微生物组模式一致。全局差异丰度分析(ANCOM-BC2,经过母亲年龄和孕前BMI的调整)发现支原体是唯一一个达到FDR校正显著性的属(LFC = +1.004,q = 0.049),还有十个额外的属达到了名义显著性(p < 0.05)。在折叠内特征重要性和稳定性分析中,一贯地优先考虑人体测量变量(BMI,孕前体重),以及在100%的交叉验证迭代中检测到的肠球菌和支原体,指示相对信号稳定性,尽管样本量有限。结论 本研究展示了泄漏意识的描述性机器学习如何在小型、代表性不足的队列中组织、优先和解释临床与微生物组信号。目前,它尚未提供针对早产的临床可部署预测工具,但我们正在努力朝这个明确目标前进,同时考虑产前筛查策略。观察到的内部区分在这个意义上反映了特定队列的结构,而不是经过验证的预测性能,为将来在拉丁美洲人群中外部验证的分类器建立了方法学基础。
Ruhle等(Thu)研究了这个问题。