Los puntos clave no están disponibles para este artículo en este momento.
La creación de conjuntos de datos de estándar dorado es un negocio costoso. Optimalmente, se obtiene más de un juicio por documento para asegurar una alta calidad en las anotaciones. En este contexto, exploramos cuánto difieren las anotaciones de los expertos entre sí, cómo diferentes conjuntos de anotaciones influyen en el ranking de los sistemas y si estas anotaciones pueden obtenerse mediante un enfoque de participación colectiva. Este estudio se aplica a anotaciones de imágenes con múltiples conceptos. Un subconjunto de las imágenes empleadas en la última competencia de Anotación Fotográfica ImageCLEF fue anotado manualmente por anotadores expertos y no expertos con Mechanical Turk. El acuerdo entre anotadores se calcula a un nivel basado en imágenes y conceptos utilizando votación mayoritaria, precisión y estadísticas kappa. Además, se utiliza la prueba de correlación de Kendall τ y Kolmogorov-Smirnov para comparar el ranking de los sistemas respecto a diferentes verdades fundamentales y diferentes medidas de evaluación en un escenario de referencia. Los resultados muestran que, aunque el acuerdo entre expertos y no expertos varía según la medida utilizada, su influencia en las listas clasificadas de los sistemas es bastante pequeña. En resumen, la votación mayoritaria aplicada para generar un conjunto de anotaciones a partir de varias opiniones es capaz de filtrar juicios ruidosos de no expertos hasta cierto punto. El conjunto de anotaciones resultante tiene una calidad comparable a las anotaciones de expertos.
Nowak et al. (2010) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: