Los puntos clave no están disponibles para este artículo en este momento.
La integración de datos es un problema bien motivado en el dominio de la ciencia de datos clínicos. La disponibilidad de datos de pacientes, casos clínicos de referencia y conjuntos de datos para investigación tiene el potencial de avanzar en la industria de la salud. Sin embargo, la naturaleza no estructurada (datos de texto, audio o video) y heterogénea de los datos, la variedad de estándares y formatos de datos, y la restricción de privacidad del paciente hacen que la interoperabilidad e integración de datos sea un desafío. El texto clínico se clasifica en diferentes grupos semánticos y puede almacenarse en diferentes archivos y formatos. Incluso la misma organización puede almacenar casos en diferentes estructuras de datos, lo que hace que la integración de datos sea más desafiante. Con tal complejidad inherente, a menudo se requiere la intervención de expertos del dominio y conocimiento del dominio para realizar la integración de datos. Sin embargo, el trabajo humano especializado es prohibitivo en tiempo y costos. Para superar la variabilidad en la estructura, formato y contenido de las diferentes fuentes de datos, mapeamos el texto en categorías comunes y calculamos similitudes dentro de ellas. En este documento, presentamos un método para categorizar y fusionar datos clínicos considerando la semántica subyacente detrás de los casos y utilizamos información de referencia sobre los casos para realizar la integración de datos. La evaluación muestra que pudimos fusionar el 88% de los datos clínicos de cinco fuentes diferentes.
Deshpande et al. (Mon,) estudiaron esta cuestión.