Key points are not available for this paper at this time.
Os Modelos de Linguagem Visual (VLMs) demonstram uma notável proficiência em abordar uma ampla gama de questões visuais, o que requer fortes faculdades de percepção e raciocínio. Avaliar essas duas competências de forma independente é crucial para o refinamento do modelo, apesar da dificuldade inerente devido à natureza entrelaçada de ver e raciocinar nos VLMs existentes. Para enfrentar essa questão, apresentamos o Prism, uma estrutura inovadora projetada para desentrelaçar os processos de percepção e raciocínio envolvidos na resolução de questões visuais. O Prism é composto por duas etapas distintas: uma etapa de percepção que utiliza um VLM para extrair e articular informações visuais em forma textual, e uma etapa de raciocínio que formula respostas baseadas nas informações visuais extraídas utilizando um Modelo de Linguagem Grande (LLM). Este design modular permite a comparação e avaliação sistemática de VLMs tanto proprietários quanto de código aberto para suas forças de percepção e raciocínio. Nossa estrutura analítica fornece várias informações valiosas, sublinhando o potencial do Prism como uma solução econômica para tarefas de linguagem-visual. Ao combinar um VLM otimizado para percepção com um LLM poderoso voltado para raciocínio, o Prism alcança resultados superiores em tarefas gerais de linguagem-visual enquanto reduz substancialmente os custos de treinamento e operação. Avaliações quantitativas mostram que o Prism, quando configurado com um LLaVA vanilla de 2B e o GPT-3.5 acessível gratuitamente, oferece um desempenho equivalente ao de VLMs 10 vezes maiores no rigoroso benchmark multimodal MMStar. O projeto é lançado em: https: //github. com/SparksJoe/Prism.
Qiao et al. (Thu,) estudaram esta questão.