Los puntos clave no están disponibles para este artículo en este momento.
Los sistemas de vigilancia de la salud basados en contenido generado por usuarios en línea a menudo se basan en la identificación de marcadores textuales relacionados con una enfermedad objetivo. Dado el gran volumen de datos disponibles, estos sistemas se benefician de un proceso de selección automática de características. Esto se logra aplicando técnicas de aprendizaje estadístico, que no consideran la relación semántica entre las características seleccionadas y la tarea de inferencia, o bien desarrollando clasificadores de texto que requieren mucho trabajo. En este artículo, utilizamos incrustaciones de palabras (word embeddings) neuronales, entrenadas con contenido de redes sociales de Twitter, para determinar, de manera no supervisada, con qué intensidad las características textuales están vinculadas semánticamente con un concepto de salud subyacente. A continuación, perfeccionamos los métodos convencionales de selección de características operando a priori sobre variables textuales que están lo suficientemente próximas a un concepto objetivo. Nuestros experimentos se centran en el problema de aprendizaje supervisado de estimar las tasas de enfermedad tipo influenza a partir de consultas de búsqueda de Google. Se formula un concepto de «infección gripal» y se utiliza para reducir las características espurias y potencialmente confusoras seleccionadas por enfoques aplicados previamente. De esta manera, también abordamos formas de escepticismo sobre la idoneidad del espacio de características, mitigando posibles casos de sobreajuste. En última instancia, el método propuesto de selección híbrida de características crea un modelo más fiable que, según nuestro análisis empírico, mejora el rendimiento de inferencia (Mean Absolute Error) de los regresores lineales y no lineales en un 12% y un 28.7%, respectivamente.
Lampos et al. (Mon,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: