La performance des modèles de prédiction peut être évaluée à l'aide de diverses méthodes et métriques. Les mesures traditionnelles pour les résultats binaires et de survie incluent le score de Brier pour indiquer la performance globale du modèle, la statistique de concordance (ou c) pour la capacité discriminatoire (ou l'aire sous la courbe caractéristique du receveur ROC), et les statistiques de bonté d'ajustement pour la calibration. Plusieurs nouvelles mesures ont récemment été proposées, qui peuvent être considérées comme des améliorations des mesures de discrimination, y compris des variantes de la statistique c pour la survie, des tableaux de reclassification, l'amélioration nette de la reclassification (NRI), et l'amélioration intégrée de la discrimination (IDI). De plus, des mesures décisionnelles ont été proposées, y compris des courbes de décision pour tracer le bénéfice net obtenu en prenant des décisions basées sur les prédictions du modèle. Nous visons à définir le rôle de ces approches relativement nouvelles dans l'évaluation des performances des modèles de prédiction. À titre d'illustration, nous présentons une étude de cas sur la prédiction de la présence de tumeur résiduelle par rapport au tissu bénin chez des patients atteints de cancer testiculaire (n = 544 pour le développement du modèle, n = 273 pour la validation externe). Nous suggérons que le rapport sur la discrimination et la calibration sera toujours important pour un modèle de prédiction. Les mesures décisionnelles doivent être rapportées si le modèle prédictif doit être utilisé pour des décisions cliniques. D'autres mesures de performance peuvent être justifiées dans des applications spécifiques, telles que les métriques de reclassification pour obtenir un aperçu de la valeur d'ajouter un predictteur nouveau à un modèle établi.
Steyerberg et al. (2009) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: