Key points are not available for this paper at this time.
Bien que des données médicales, comportementales et socio-démographiques riches soient essentielles à la recherche moderne axée sur les données, leur collecte et leur utilisation soulèvent des préoccupations légitimes en matière de confidentialité. L'anonymisation des ensembles de données par désidentification et échantillonnage avant leur partage a été le principal outil utilisé pour répondre à ces préoccupations. Nous proposons ici une méthode basée sur une copule générative qui peut estimer avec précision la probabilité qu'une personne spécifique soit correctement ré-identifiée, même dans un ensemble de données fortement incomplet. Sur 210 populations, notre méthode obtient des scores AUC pour prédire l'unicité individuelle variant de 0,84 à 0,97, avec un faible taux de faux positifs. En utilisant notre modèle, nous trouvons que 99,98 % des Américains seraient correctement ré-identifiés dans n'importe quel ensemble de données utilisant 15 attributs démographiques. Nos résultats suggèrent que même les ensembles de données anonymisés fortement échantillonnés sont peu susceptibles de satisfaire aux normes modernes d'anonymisation établies par le RGPD et remettent sérieusement en question la pertinence technique et légale du modèle de désidentification de libération et d'oubli.
Rocher et al. (Tue,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: