Key points are not available for this paper at this time.
多模态大型语言模型(MLLMs)与机器人系统的结合显著增强了机器人解释和执行自然语言指令的能力。尽管取得了这些进展,传统的MLLMs通常是在通用的图像-文本对上训练的,缺乏诸如可操作性和物理知识等基本机器人知识,这限制了它们在操作任务中的有效性。为了弥补这一空白,我们提出了ManipVQA,这是一种新框架,旨在通过视觉问答格式赋予MLLMs以以操控为中心的知识。这种方法不仅包括工具检测和可操作性识别,还扩展到对物理概念的全面理解。我们的方法首先收集一组展示互动对象的多样图像,这展现了工具物体检测、可操作性和物理概念预测中的广泛挑战。为了将这种特定于机器人的知识与MLLMs固有的视觉推理能力无缝整合,我们采用了一个统一的VQA格式,并设计了一种微调策略,既保留原有的视觉推理能力,又融合新的机器人见解。在机器人模拟器和各种视觉任务基准中进行的实证评估表明,ManipVQA表现出强大的性能。代码和数据集将在https://github.com/SiyuanHuang95/ManipVQA上公开。
黄等(孙)研究了这个问题。