Key points are not available for this paper at this time.
背景:分类算法的性能最终会达到收益递减的点,此时增加的样本将不会改善结果。因此,需要确定一个最佳样本量,以在考虑计算负担或预算问题的情况下最大化性能。目标:本研究旨在确定最佳样本量以及不同二元分类算法中样本量与数据集特征之间的关系。方法:共收集了16个大型开放源数据集,每个数据集均包含二元临床结果。此外,评估了4种机器学习算法:XGBoost (XGB)、随机森林 (RF)、逻辑回归 (LR)和神经网络 (NN)。对于每个数据集,在增加的样本量下计算交叉验证的曲线下面积 (AUC),并拟合学习曲线。根据拟合的学习曲线,计算达到观察到的全数据集AUC减去2点(0.02)所需的样本量,并在各个数据集和算法之间进行比较。检查了数据集级特征、少数类别比例、全数据集AUC、特征数量、特征类型和非线性程度。使用负二项回归模型量化这些特征与每个算法中预期样本量之间的关系。构建了4个多变量模型,选择了最佳拟合的数据集特征组合。结果:在16个数据集中(全数据集样本量范围从70,000到1,000,000),中位样本量为9960(XGB)、3404(RF)、696(LR)和12,298(NN),以达到AUC稳定性。对于所有4种算法,较为平衡的类别(倍数:少数类别比例增加1%时为0.93-0.96)与样本量减少相关。其他特征在算法间的重要性差异较大——一般来说,更多特征、较弱特征和预测变量与响应之间更复杂的关系会增加预期样本量。在多变量分析中,4种算法中选择的最佳预测变量为少数类别比例、全数据集AUC(XGB、RF和NN)和数据集非线性(XGB、RF和NN)。对于LR,主要预测变量为少数类别比例、强线性特征的百分比和特征数量。最终的多变量样本量模型具有高拟合优度,数据集级预测变量解释了4个模型中数据总偏差的多数(66.5%-84.5%)。结论:达到AUC稳定性所需的样本量在4种流行分类算法中因数据集和方法而异,并与可以在研究开始之前受到影响或估算的数据集特征相关。
Silvey等(星期二)研究了这个问题。