Key points are not available for this paper at this time.
A capacidade de modelos inteligentes para extrapolar e compreender mudanças nos estados dos objetos é um aspecto crucial, mas exigente, da pesquisa em IA, particularmente através da perspectiva da interação humana em contextos do mundo real. Esta tarefa envolve descrever ambientes visuais complexos, identificar objetos ativos e interpretar suas mudanças conforme transmitido através da linguagem. Métodos tradicionais, que isolam a legendagem de objetos e a detecção de mudanças de estado, oferecem uma visão limitada de ambientes dinâmicos. Além disso, confiar em um pequeno conjunto de palavras simbólicas para representar mudanças restringiu a expressividade da linguagem. Para enfrentar esses desafios, neste artigo, introduzimos o conjunto de dados e benchmark Object State Captioning and State Change Representation (OSCaR). O OSCaR consiste em 14.084 segmentos de vídeo anotados com quase 1.000 objetos únicos de diversas coleções de vídeo egocêntricas. Ele estabelece um novo teste para a avaliação de modelos de linguagem de grande escala multimodais (MLLMs). Nossos experimentos demonstram que, embora os MLLMs mostrem alguma habilidade, eles carecem de uma compreensão completa das mudanças de estado dos objetos. O benchmark inclui um modelo ajustado que, apesar das capacidades iniciais, requer melhorias significativas em precisão e capacidade de generalização para uma compreensão eficaz dessas mudanças. Nosso código e conjunto de dados estão disponíveis em https://github.com/nguyennm1024/OSCaR.
Nguyen et al. (Mon,) estudaram esta questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: