Key points are not available for this paper at this time.
心脏病发病率的持续上升已成为重大的公共卫生挑战,它是全球主要死亡原因之一。精准预测心脏病风险并进行早期干预至关重要。本研究探讨了利用机器学习和深度学习算法提高心脏病预测模型性能的方法。首先,我们使用了来自 Kaggle 的 Heart Failure Prediction Dataset。在进行预处理以确保数据质量后,应用了三种不同的特征工程技术:用于降维的 PCA、用于特征选择的 ET 以及用于特征选择的 Pearson's correlation coefficient。我们评估了它们对模型性能的影响。随后将数据集按三种不同的数据划分比例(1:9、2:8 和 3:7)进行划分,以确定其对模型性能的具体影响。基于五项关键指标(准确率、召回率、精确率、F1 score 和训练时间),对 12 种机器学习分类器——LGBM、Adaboost、XGB、RF、DT、KNN、LR、GNB、ET、SVC、GB 和 Bagging——进行了训练和评估。利用配对样本 t 检验系统分析了不同特征工程方法和数据划分比例对模型性能的影响。在所比较的特征工程方法中,Bagging 分类器在结合通过 ET 进行特征选择时表现出优异的性能。在测试集与训练集划分比例为 1:9 时,其准确率达到 97.48 %,F1-Score 达到 97.48 %。在 2:8 划分比例下,准确率为 94.96 %,F1-Score 为 94.95 %。在 3:7 划分比例下,准确率为 94.12 %,F1-Score 为 94.11 %。配对样本 T 检验结果表明,使用 Pearson correlation coefficient 进行特征选择可以缩短训练时长,但这也会导致分类器性能下降。在应用 PCA 降维后,与对照组相比,分类器的训练效率和有效性无显著差异。然而,通过 ET 进行特征选择在确保各分类器性能的同时,显著缩短了训练时间。
Wang et al. (Thu,) 研究了这一问题。