Los puntos clave no están disponibles para este artículo en este momento.
Mientras que los modelos de lenguaje grandes (LLMs) han alcanzado un rendimiento de vanguardia en una amplia gama de tareas de respuesta a preguntas médicas (QA), todavía enfrentan desafíos con alucinaciones y conocimiento desactualizado. La generación aumentada por recuperación (RAG) es una solución prometedora y ha sido ampliamente adoptada. Sin embargo, un sistema RAG puede involucrar múltiples componentes flexibles, y hay una falta de mejores prácticas respecto a la configuración óptima de RAG para diversos propósitos médicos. Para evaluar sistemáticamente tales sistemas, proponemos la Evaluación de Generación Aumentada por Recuperación de Información Médica (MIRAGE), un benchmark pionero que incluye 7,663 preguntas de cinco conjuntos de datos de QA médica. Utilizando MIRAGE, realizamos experimentos a gran escala con más de 1.8 billones de tokens de solicitud en 41 combinaciones de diferentes corpus, recuperadores y LLMs de base a través de la herramienta MEDRAG introducida en este trabajo. En general, MEDRAG mejora la precisión de seis LLMs diferentes en hasta un 18% en comparación con los impulsos de cadena de pensamiento, elevando el rendimiento de GPT-3.5 y Mixtral al nivel de GPT-4. Nuestros resultados muestran que la combinación de varios corpus médicos y recuperadores logra el mejor rendimiento. Además, descubrimos una propiedad de escalado log-lineal y los efectos de "perdido en el medio" en RAG médica. Creemos que nuestras evaluaciones completas pueden servir como guías prácticas para implementar sistemas RAG para la medicina.
Xiong et al. (Mon,) estudiaron esta pregunta.