Los puntos clave no están disponibles para este artículo en este momento.
Las colecciones de pruebas a gran escala juegan un papel crucial en la investigación de Recuperación de Información (IR). Sin embargo, de acuerdo con el paradigma de Cranfield y la investigación sobre conjuntos de datos disponibles públicamente, los estudios de investigación en recuperación de información existentes se desarrollan comúnmente en conjuntos de datos a pequeña escala que dependen de evaluadores humanos para los juicios de relevancia, un proceso que consume tiempo y es costoso. Estudios recientes han demostrado la fuerte capacidad de los Modelos de Lenguaje Grande (LLMs) para producir juicios de relevancia fiables con precisión humana pero a un costo significativamente reducido. En este documento, para abordar la falta de un conjunto de datos de recuperación de documentos ad-hoc a gran escala, extendemos la colección de pruebas del TREC Deep Learning Track (DL) a través de etiquetas sintéticas de modelos de lenguaje adicionales para permitir que los investigadores prueben y evalúen sus sistemas de búsqueda a gran escala. Específicamente, dicha colección de pruebas incluye más de 1,900 consultas de prueba de los años anteriores de las pistas. Comparamos la evaluación del sistema con las etiquetas humanas de años anteriores y encontramos que nuestra colección de pruebas sintéticas a gran escala puede llevar a clasificaciones de sistema altamente correlacionadas.
Rahmani et al. (Thu,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: