Key points are not available for this paper at this time.
视觉问答(VQA)在计算机视觉和自然语言处理领域引起了广泛关注,尤其是因为它提供了对两种重要信息源之间关系的洞察。当前的数据集和基于其构建的模型,聚焦于可以通过直接分析问题和图像本身回答的问题。这些无需外部信息回答的问题集虽然有趣,但非常有限。例如,它排除了需要常识或基本事实知识来回答的问题。在这里,我们介绍FVQA(基于事实的VQA),这是一个需要并支持更深层次推理的VQA数据集。FVQA主要包含需要外部信息回答的问题。因此,我们通过额外的图像-问题-答案-支持事实元组扩展了传统的视觉问答数据集,该数据集包含图像-问题-答案三元组。每个支持事实都表示为一个结构三元组,例如。
Wang等(周)研究了这个问题。