La sociedad globalmente interconectada de hoy plantea grandes demandas sobre la difusión y el intercambio de información. Mientras que en el pasado la información liberada era mayormente en forma de tablas y estadísticas, muchas situaciones requieren la liberación de datos específicos (microdatos). Para proteger la anonimidad de las entidades (llamadas encuestados) a las que se refiere la información, los poseedores de datos a menudo eliminan o cifran identificadores explícitos como nombres, direcciones y números de teléfono. Sin embargo, la desidentificación de datos no garantiza la anonimidad. La información liberada a menudo contiene otros datos, como raza, fecha de nacimiento, sexo y código postal, que pueden estar vinculados a información disponible públicamente para reidentificar a los encuestados e inferir información que no estaba destinada a ser divulgada. En este documento abordamos el problema de liberar microdatos mientras salvaguardamos la anonimidad de los encuestados a los que se refiere la información. El enfoque se basa en la definición de k-anonimato. Una tabla ofrece k-anonimato si los intentos de vincular información de identificación explícita a su contenido mapean la información a al menos k entidades. Ilustramos cómo se puede proporcionar k-anonimato sin comprometer la integridad (o veracidad) de la información liberada utilizando técnicas de generalización y supresión. Introducimos el concepto de generalización mínima que captura la propiedad del proceso de liberación que no distorsiona los datos más de lo necesario para lograr k-anonimato, y presentamos un algoritmo para el cálculo de tal generalización. También discutimos posibles políticas de preferencia para elegir entre diferentes generalizaciones mínimas.
Pierangela Samarati (2001) estudió esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: