Key points are not available for this paper at this time.
本研究探讨了从单目RGB-D图像中估计人类姿态和形状的问题。RGB-D输入中的深度信息允许精确的3D人类重建。然而,RGB-D数据集的有限大小限制了现有基于RGB-D的方法的泛化能力。在此信中,我们提出了一种新颖的架构,视图渲染网络(VRNet),它利用RGB-D输入中的基础3D结构,并利用额外的RGB数据集进行训练。VRNet通过一种新颖的特征渲染方法合成伪多视图表示。合成的多视图特征图通过多阶段多视图融合(MMF)进行聚合,以施加3D结构约束。我们展示了VRNet能够自然地采用混合RGB/RGB-D训练和推理技术,从而改善模型的泛化能力。我们开展了全面的实验以研究VRNet的有效性。作为一个示例,所提出的VRNet在Human3.6M数据集上将MPJPE和PA-MPJPE分别提高了15.2毫米和4.9毫米。
Zhu等(周四)研究了这个问题。