Los puntos clave no están disponibles para este artículo en este momento.
La creciente disponibilidad de conjuntos de datos estructurados, desde tablas de la web y portales de datos abiertos hasta datos empresariales, abre oportunidades para enriquecer el análisis y mejorar los modelos de aprendizaje automático a través de la augmentación de datos relacionales. En este artículo, introducimos una nueva clase de consultas de augmentación de datos: consultas de correlación de uniones. Dada una columna Q y una columna de unión KQ de una tabla de consulta TQ, se recuperan tablas TX en una colección de conjuntos de datos de manera que TX se pueda unir con TQ en KQ y exista una columna C ∈ TX tal que Q esté correlacionada con C. Un enfoque ingenuo para evaluar estas consultas, que primero encuentra tablas unibles y luego une explícitamente y calcula las correlaciones entre Q y todas las columnas de las tablas descubiertas, es excesivamente costoso. Para soportar de manera eficiente el descubrimiento de columnas correlacionadas, 1) proponemos un método de esbozo que permite la construcción de un índice para un gran número de tablas y que proporciona estimaciones precisas para consultas de correlación de uniones, y 2) exploramos diferentes estrategias de puntuación que clasifican eficazmente los resultados de la consulta en función de cuán bien están correlacionadas las columnas con la consulta. Llevamos a cabo una evaluación experimental detallada, utilizando tanto datos sintéticos como reales, que muestra que nuestros esbozos alcanzan alta precisión y las estrategias de puntuación conducen a clasificaciones de alta calidad.
Santos et al. (Wed,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: