Key points are not available for this paper at this time.
摘要:基于引用的图像分割旨在根据引用表达来分割图像中的对象。其难点在于对齐表达语义与视觉实例。现有的基于语义推理的方法受到外部语法解析器性能的限制,未能明确探讨视觉实例之间的关系。本文提出了一种端到端的方法,通过将‘语言关系’与‘视觉关系’对齐来实现引用图像分割。该方法不依赖外部语法解析器进行表达解析。在本文中,表达通过语义组件解析器(SCP)以可学习的方式自适应地和结构性地解析为三个组成部分:‘主语’、‘宾语’和‘语言关系’。实例激活图模块(IAM)根据主语和宾语定位多个视觉实例。此外,基于关系的视觉定位模块(RBVL)首先使图像的每个实例学习全局知识,然后解码这些视觉实例之间的视觉关系,最后将视觉关系与语言关系对齐,以进一步准确定位目标对象。实验结果表明,所提出的方法在多个引用图像分割数据集上相比基线方法提升了4-9%的性能。
Pu等人(周四)研究了这个问题。