Les grands modèles de langage (LLMs) comme ChatGPT ont montré des avancées significatives dans diverses tâches de compréhension du langage naturel (NLU), y compris le dialogue intelligent et les agents autonomes. Cependant, en l'absence de mécanismes de test largement reconnus, répondre à la question `si les LLMs sont des perroquets stochastiques ou comprennent vraiment le monde' reste flou, entraînant de nombreuses études et suscitant des débats animés. La recherche actuelle se concentre principalement sur la NLU à un niveau superficiel, négligeant les explorations plus fines. Cependant, de telles explorations sont cruciales pour comprendre leurs mécanismes de compréhension uniques, en alignement avec la cognition humaine, et enfin améliorer les capacités générales de NLU des LLMs. Pour combler cette lacune, notre étude plonge dans les capacités de compréhension sémantique nuancée des LLMs, en particulier concernant les mots courants avec des significations rares. L'idée découle de principes fondamentaux de la communication humaine en psychologie, qui soulignent l'importance d'une compréhension partagée précise de la sémantique des mots. Plus précisément, cet article présente la construction innovante d'un ensemble de données de compréhension sémantique lexicale (LeSC) avec des métriques d'évaluation novatrices, le premier repère englobant à la fois des dimensions fines et translinguales. En introduisant des modèles tant à code source ouvert que fermé, avec des échelles et des architectures variées, nos expériences empiriques extensives montrent la performance inférieure des modèles existants dans cette tâche de compréhension du sens lexical de base. Notamment, même les LLMs à la pointe de la technologie GPT-4 et GPT-3.5 sont en retard par rapport à des humains de 16 ans de 3,9 % et 22,3 %, respectivement. De plus, plusieurs techniques avancées de prompting et une génération augmentée par récupération sont également introduites pour aider à atténuer ce problème, mais des limitations persistent. En mettant en évidence ces lacunes critiques, cette recherche motive une enquête ultérieure et offre de nouvelles perspectives pour le développement de LLMs plus intelligents.
Wu et al. (2024) ont étudié cette question.