Key points are not available for this paper at this time.
人-物交互(HOI)作为计算机视觉中的一个重要问题,需要定位人-物对并识别它们之间的交互关系。与单个目标实例相比,HOI 实例在空间、尺度和任务上的跨度更大,使其检测更容易受到嘈杂背景的干扰。为了减轻嘈杂背景对 HOI 检测的干扰,有必要结合输入图像信息生成细粒度锚点,进而利用这些锚点指导 HOI 实例的检测。然而,这面临以下挑战:i) 如何从包含复杂背景信息的图像中提取关键特征仍是一个悬而未决的问题。ii) 如何在语义上对齐提取的特征与查询嵌入也是一个难题。在本文中,提出了一种新颖的基于 Transformer 的端到端框架(FGAHOI)来缓解上述问题。FGAHOI 包含三个专用组件,即多尺度采样(MSS)、分层空间感知合并(HSAM)和任务感知合并机制(TAM)。MSS 从嘈杂背景中提取不同尺度 HOI 实例的人、物体和交互区域特征。HSAM 和 TAM 分别从分层空间和任务角度依次对提取的特征和查询嵌入进行语义对齐与合并。同时,设计了一种新颖的分阶段训练策略(Stage-wise Training Strategy),以减轻 FGAHOI 执行过于复杂任务所带来的训练压力。此外,我们提出了两种衡量 HOI 检测难度的方法,以及一个针对 HOI 实例检测中两大挑战(人-物对分布区域不均以及人-物对的长距离视觉建模)的新型数据集,即 HOI-SDC。实验在三个基准数据集上进行:HICO-DET、HOI-SDC 和 V-COCO。我们的模型优于最先进的 HOI 检测方法,大量消融实验展示了我们所提贡献的优势。
Ma et al. (Fri,) 对这一问题进行了研究。