Alors que les grands modèles linguistiques (LLMs) deviennent de plus en plus centraux dans les applications de traitement du langage naturel en arabe, évaluer leur compréhension des dialectes régionaux et des nuances culturelles est essentiel, notamment dans des contextes linguistiquement diversifiés comme l'Arabie Saoudite. Cet article présente Absher, une référence complète spécialement conçue pour évaluer la performance des LLMs à travers les principaux dialectes saoudiens. Absher comprend plus de 18 000 questions à choix multiples réparties dans six catégories distinctes : Signification, Vrai/Faux, Compléter, Utilisation Contextuelle, Interprétation Culturelle et Reconnaissance de Lieu. Ces questions sont dérivées d'un ensemble de données organisé de mots dialectaux, de phrases et de proverbes provenant de diverses régions de l'Arabie Saoudite. Nous évaluons plusieurs LLMs à la pointe de la technologie, y compris des modèles multilingues et spécifiques à l'arabe. Nous fournissons également des informations détaillées sur leurs capacités et limitations. Nos résultats révèlent des écarts de performance notables, notamment dans les tâches nécessitant une inférence culturelle ou une compréhension contextuelle. Nos résultats soulignent l'urgence d'une formation tenant compte des dialectes et de méthodologies d'évaluation culturellement alignées pour améliorer la performance des LLMs dans les applications arabes du monde réel.
Al-Monef et al. (Mon,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: