肺癌可以在早期被发现,以提高患者生存率。然而,现有的筛查工具既资源密集又在资源匮乏的国家难以获得。本文介绍了一种机器学习模型,该模型采用集成方法从基于症状的调查数据集中预测肺癌。所建议的方法通过使用类加权学习和分层的训练-验证-测试划分来利用不平衡数据,以防止数据泄漏,并在验证集上优化决策阈值以最大化临床灵敏度。测试了多个集成模型,CatBoost达到了最佳验证性能。优化后的模型在留出的测试集上达到95.16的准确率和93.75的ROC-AUC,完美的召回率且没有假阴性。广泛的分析,包括校准、小组分析、性能分析、特征重要性分析和风险分层证据,显示了所提框架的合理性和可读性。上述发现表明,基于症状的集成学习模型可能作为肺癌初步风险评估和临床分诊的补充措施是有用的。
Yousuf Nasser Al Husaini (Mon,) 研究了这个问题。