Les progrès remarquables des Modèles de Langage Multimodaux de Grande Taille (MLLM) ont suscité une attention sans précédent, en raison de leur performance supérieure dans les contextes visuels. Cependant, leurs capacités en résolution de problèmes mathématiques visuels restent insuffisamment évaluées et comprises. Nous examinons les références actuelles pour incorporer un contenu visuel excessif au sein des questions textuelles, ce qui permet potentiellement aux MLLM de déduire des réponses sans véritablement interpréter les diagrammes d'entrée. À cette fin, nous introduisons MathVerse, un benchmark visuel mathématique tout-en-un conçu pour une évaluation équitable et approfondie des MLLM. Nous collectons méticuleusement 2 612 problèmes mathématiques de haute qualité, multi-sujets, avec diagrammes provenant de sources publiques. Chaque problème est ensuite transformé par des annotateurs humains en six versions distinctes, chacune offrant des degrés variés de contenu d'information en multimodalité, contribuant à un total de 15K échantillons de test. Cette approche permet à MathVerse d'évaluer de manière exhaustive si et dans quelle mesure les MLLM peuvent vraiment comprendre les diagrammes visuels pour le raisonnement mathématique. De plus, nous proposons une stratégie d'évaluation Chaîne de Pensées (CoT) pour une évaluation fine des réponses de sortie. Plutôt que de juger naïvement Vrai ou Faux, nous utilisons GPT-4(V) pour extraire de manière adaptative les étapes de raisonnement cruciales, puis notons chaque étape avec une analyse d'erreurs détaillée, ce qui peut révéler la qualité du raisonnement intermédiaire CoT par les MLLM. Nous espérons que le benchmark MathVerse pourra fournir des informations uniques pour guider le développement futur des MLLM. Page du projet : https://mathverse-cuhk.github.io
Zhang et al. (Jeu,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: