La génération augmentée par récupération (RAG) a gagné en importance en tant que méthode efficace pour améliorer les capacités génératives des grands modèles de langage (LLMs) grâce à l'incorporation de connaissances externes. Cependant, l'évaluation des systèmes RAG reste un défi en raison de l'interaction complexe entre les composants de récupération et de génération. Cette limitation a entraîné une pénurie de benchmarks permettant une évaluation détaillée et spécifique des composants. Dans ce travail, nous présentons MIRAGE, un ensemble de données de questions-réponses spécifiquement conçu pour l'évaluation RAG. MIRAGE se compose de 7 560 instances curées mappées à un pool de récupération de 37 800 entrées, permettant une évaluation efficace et précise des tâches de récupération et de génération. Nous introduisons également de nouvelles métriques d'évaluation visant à mesurer l'adaptabilité du RAG, englobant des dimensions telles que la vulnérabilité au bruit, l'acceptabilité du contexte, l'insensibilité au contexte et la mauvaise interprétation du contexte. À travers des expériences complètes sur diverses configurations de récupérateur-LLM, nous fournissons de nouvelles perspectives sur l'alignement optimal des paires de modèles et la dynamique nuancée au sein des systèmes RAG. L'ensemble de données et le code d'évaluation sont disponibles publiquement, permettant une intégration et une personnalisation sans faille dans divers contextes de recherche {Le code et les données de MIRAGE sont disponibles sur https://github.com/nlpai-lab/MIRAGE.
Park et al. (Mercredi,) ont étudié cette question.