Key points are not available for this paper at this time.
A Resposta a Perguntas Visuais (VQA) é uma tarefa desafiadora que tem recebido atenção crescente tanto das comunidades de visão computacional quanto de processamento de linguagem natural. Trabalhos atuais em VQA focam em perguntas que podem ser respondidas através da análise direta da pergunta e da imagem apenas. Apresentamos um algoritmo consciente de conceitos, ConceptBert, para perguntas que requerem bom senso, ou conhecimento básico de fatos a partir de conteúdo estruturado externo. Dada uma imagem e uma pergunta em linguagem natural, o ConceptBert requer elementos visuais da imagem e um Grafo de Conhecimento (KG) para inferir a resposta correta. Introduzimos uma representação multimodal que aprende uma incorporação conjunta de Conceito-Visão-Linguagem. Exploramos o KG do ConceptNet para codificar o conhecimento de bom senso e avaliamos nossa metodologia nos conjuntos de dados Outside Knowledge-VQA (OK-VQA) e VQA. Nosso código está disponível em
Gardères et al. (Quarta-feira,) estudaram esta questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: