患者报告的调查数据被用于训练旨在改善医疗服务的预后模型。然而,此类数据通常分布在多个中心,出于隐私原因,不易集中到一个数据仓库中。在本地训练的模型准确性、稳健性和泛化性较差。我们旨在探讨保护隐私的联邦机器学习技术在基于健康调查数据构建预后模型中的适用性,其中本地数据绝不离开医疗中心具有法律保障的安全港。我们在两个医疗数据集(来自丹麦五个卫生大区的 GLA: D ® 数据和涵盖 27 个国家的国际 SHARE 数据)上应用了集中式、本地和联邦学习技术,以预测两种不同的健康结局。我们比较了在本地数据上训练的线性回归、随机森林回归和随机森林分类模型与以集中式和联邦式方式在全部数据上训练的模型。在 GLA: D ® 数据中,联邦线性回归(R 2 0.34,RMSE 18.2)和联邦随机森林回归(R 2 0.34,RMSE 18.3)模型的表现具有统计学显著性地优于其对应的本地模型(即 R 2 0.32,RMSE 18.6;R 2 0.30,RMSE 18.8)。我们还发现,集中式模型(分别为 R 2 0.34,RMSE 18.2;R 2 0.32,RMSE 18.5)的表现并未显著优于联邦模型。在 SHARE 中,联邦模型(AC 0.78,AUROC: 0.71)和集中式模型(AC 0.84,AUROC: 0.66)的表现显著优于本地模型(AC: 0.74,AUROC: 0.69)。联邦学习使得利用多中心调查训练预后模型成为可能,既不损害隐私,又对模型性能几乎没有或完全没有折损。
Das et al. (Wed,) 对该问题进行了研究。