3D视觉定位是人机交互的一个基础任务,旨在根据自然语言描述定位复杂3D点云中的特定物体。尽管最近取得了一些进展,但现有的基于Transformer的架构往往依赖绝对位置嵌入和启发式查询初始化,这使其缺乏捕捉细粒度相对空间依赖关系的能力,并且无法有效过滤场景杂物。在本文中,我们提出了SESQ,一个新颖的框架,协同空间感知编码和语义引导查询以实现3D定位。我们的方法引入了两个关键创新。首先,我们提出了旋转空间感知编码器(RSAE),该编码器将旋转位置嵌入(RoPE)纳入自注意力层。通过将3D坐标转换为旋转表示,RSAE使模型能够内在地捕获相对空间距离,并在编码阶段保持几何一致性。其次,设计了语义查询初始化(SQI)模块,通过明确计算文本嵌入和视觉点云特征之间的跨模态相似性来初始化物体查询。通过用语义感知的对齐替换传统的启发式选择,SQI确保解码过程始于上下文相关的物体候选,从而显著减少与任务无关的干扰项的影响。在ScanRefer和ReferIt3D(Nr3D/Sr3D)基准上的大量实验展示了我们框架的有效性。与基线EDA相比,我们的方法在ScanRefer的整体Acc@0.5上获得了2.68%的显著性能提升,在具有挑战性的Nr3D “Hard”子集上提升了4.9%,在Sr3D的整体Acc@0.25上增加了1.1%。”},{
Li et al. (Sun,) studied this question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: