Key points are not available for this paper at this time.
A maioria dos modelos de Resposta a Perguntas Visuais (VQA) sofre do problema do prior de linguagem, que é causado por preconceitos inerentes aos dados. Especificamente, os modelos de VQA tendem a responder perguntas (por exemplo, qual a cor da banana?) com base nas respostas de alta frequência (por exemplo, amarelo), ignorando o conteúdo da imagem. Abordagens existentes enfrentam esse problema criando modelos delicados ou introduzindo anotações visuais adicionais para reduzir a dependência da pergunta e fortalecer a dependência da imagem. No entanto, ainda estão sujeitas ao problema do prior de linguagem, uma vez que os preconceitos dos dados não foram abordados fundamentalmente. Neste artigo, apresentamos uma estrutura de aprendizado auto-supervisionado para resolver esse problema. Concretamente, primeiro geramos automaticamente dados rotulados para equilibrar os dados tendenciosos e, em seguida, propomos uma tarefa auxiliar auto-supervisionada para utilizar os dados equilibrados para ajudar o modelo VQA a superar os priors de linguagem. Nosso método pode compensar os preconceitos dos dados gerando dados equilibrados sem introduzir anotações externas. Resultados experimentais mostram que nosso método alcança desempenho de ponta, melhorando a precisão geral de 49,50% para 57,59% no benchmark VQA-CP v2 mais comumente utilizado. Em outras palavras, podemos aumentar o desempenho de métodos baseados em anotações em 16% sem usar anotações externas. Nosso código está disponível no GitHub.
Zhu et al. (Qua,) estudaram essa questão.
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: