人类通过结合视觉推理、主动视角调整和物理互动,能够在杂乱和部分可观察环境中轻松检索物体,仅用一双眼睛。相比之下,大多数现有的机器人系统依赖于精确布置的固定或多相机设置,并要求完全的场景可见性,这限制了适应性并造成高昂的硬件成本。我们提出了RoboRetriever,一种仅使用单个腕部安装的RGB-D相机和自由形式自然语言指令的真实世界物体检索新框架。RoboRetriever通过视觉观察构建和更新动态层次场景图,编码物体的语义、几何和物体间关系。监督模块在这个内存和任务指令上进行推理,以推断目标物体并协调一个集成的动作模块,该模块结合了主动感知、交互感知和操控。为了实现任务感知的场景基础主动感知,我们引入了一种新颖的视觉提示方案,利用大型推理视觉-语言模型确定与语义任务目标和几何场景上下文对齐的6自由度相机姿态。我们在多样的真实世界物体检索任务上评估了RoboRetriever,包括有人干预的场景,展示了其在杂乱场景中的强适应性和鲁棒性,仅使用一台RGB-D相机。
Wang等人(Mon,)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: