在语言引导的视觉导航中,智能体使用自然语言指令在未见环境中定位目标对象。为了在陌生场景中进行可靠的导航,智能体应该具备强大的感知、规划和预测能力。此外,当智能体在长期导航期间重新访问先前探索的区域时,它们可能会保留无关和多余的历史感知,导致次优结果。在这项工作中,我们提出了RoboTron-Nav,一个通过多任务协作在导航和具身问答任务上集成感知、规划和预测能力的统一框架,从而提升导航性能。此外,RoboTron-Nav采用自适应的3D感知历史采样策略,以有效和高效地利用历史观察。通过利用大型语言模型,RoboTron-Nav能够理解多样的命令和复杂的视觉场景,从而做出适当的导航动作。RoboTron-Nav在CHORES-S基准上实现了81.1%的目标对象导航成功率,创造了新的最先进性能。项目页面:https://yvfengzhong.github.io/RoboTron-Nav
Zhong等人(周一)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: