Key points are not available for this paper at this time.
针对机器人应用的3D场景理解具有独特的需求,包括实时推理、对象中心潜在表示学习、准确的6D姿态估计和对象的3D重建。目前场景理解的方法通常依赖于训练模型的组合,这些模型配合显式或学习得到的体积表示,这些方法各有缺陷和局限性。我们引入了DreamUp3D,这是一种新颖的对象中心生成模型(OCGM),专门设计用于仅通过单个RGB-D图像进行3D场景推理。DreamUp3D是一个自我监督模型,采用端到端的训练方式,能够进行对象分割、提供3D对象重建、生成对象中心潜在表示和准确的每个对象6D姿态估计。我们将DreamUp3D与基线(包括NeRF、预训练的CLIP特征、ObSurf和ObPose)在多项任务(包括3D场景重建、对象匹配和对象姿态估计)中进行比较。我们的实验表明,我们的模型在实际场景中显著超越了所有基线,展示了其在3D场景理解任务中的适用性,同时满足机器人应用中所表现出的严格要求.
Wu等(Mon,)研究了这个问题.