Key points are not available for this paper at this time.
尽管有助于鼓励视觉问题回答(VQA)模型通过利用超越图像和文本上下文的输入输出关联来发现潜在知识,但现有的知识VQA数据集大多是以众包的方式注释的,例如,通过互联网从不同用户收集问题和外部理由。除了知识推理的挑战外,如何处理注释者偏差仍然没有解决,这往往导致问题和答案之间的表面过拟合关联。为了解决这个问题,我们提出了一个名为知识导向的视觉问题推理的新数据集,用于VQA模型评估。考虑到一个理想的VQA模型应能够正确感知图像上下文,理解问题,并整合其学到的知识,我们提出的数据集旨在切断当前深度嵌入模型利用的捷径学习,并推动基于知识的视觉问题推理的研究边界。具体而言,我们根据视觉基因组场景图和受控程序中的外部知识库生成问题-答案对,以解开知识与其他偏差的关系。程序可以从场景图或知识库中选择一到两个三元组以推动多步骤推理,避免答案模糊,并平衡答案分布。与现有的VQA数据集相比,我们进一步对程序施加以下两个主要约束以纳入知识推理。首先,多个知识三元组可以与问题相关,但唯一与图像对象相关的知识只有一个。这可以强制VQA模型正确感知图像,而不是仅仅根据给定问题猜测知识。其次,所有问题基于不同的知识,但是候选答案在训练和测试集上是相同的。我们在训练期间使测试知识未使用,以评估模型是否能够理解问题词并处理未见过的组合。进行了广泛的实验,使用各种基线和最先进的VQA模型,结果表明,当给定嵌入知识库时,模型拥有和不拥有真实支持三元组之间依然存在很大的差距。这揭示了当前深度嵌入模型在知识推理问题上的弱点.
曹等(周五)研究了这个问题。
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: