Key points are not available for this paper at this time.
图像字幕旨在理解图像中的各种语义概念(例如,物体和关系),并将它们整合在句子级描述中。因此,有必要学习这些概念之间的交互。如果我们定义交互的上下文为涉及主谓宾三元组,大多数当前方法仅关注单一三元组以生成第一阶交互的句子。直观上,我们人类能够感知来自两个或多个三元组的概念的高阶交互,以描述图像。例如,当我们看到三元组 "人-切-三明治" 和 "人-与-刀" 时,自然会整合并预测句子 "人用刀切三明治"。这依赖于在不同三元组中 "切" 和 "刀" 之间的高阶交互。因此,利用高阶交互有望促进图像字幕的生成并集中于推理。在本文中,我们在编码器-解码器框架下引入了一种新颖的高阶交互学习方法,针对检测到的物体和关系进行图像字幕生成。我们首先提取图像中一组物体和关系特征。在编码阶段,提出了互动精炼网络,通过自注意力的方式建模物体内部及间的特征交互来学习高阶表示。在解码阶段,提出了互动融合网络,基于语言上下文,通过增强其高阶交互来整合物体和关系信息,以生成句子。通过这种方式,我们在不同阶段学习物体-关系依赖关系,可以为视觉理解和字幕生成提供丰富的线索。大量实验表明,该方法在MSCOCO数据集上能够达到与最先进的方法相当的性能。额外的消融研究进一步验证了其有效性。
王等(周二)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: