Key points are not available for this paper at this time.
面部表情和手势对于表达我们的情感和与世界互动是必不可少的。然而,大多数从随意捕捉的视频中建模的3D人类虚拟人仅支持身体动作,而没有面部表情和手势。在这项工作中,我们提出了ExAvatar,一个从短的单目视频中学习的表现力全身3D人类虚拟人。我们将ExAvatar设计为全身参数化网格模型(SMPL-X)和3D高斯散点(3DGS)的结合。面临的主要挑战是1)视频中面部表情和姿势的多样性有限;2)缺乏3D观测数据,例如3D扫描和RGBD图像。视频中的多样性有限使得用新颖的面部表情和姿势进行动画制作变得复杂。此外,缺乏3D观测数据可能导致在视频中未观测到的人体部位出现显著模糊,可能会在新动作下造成明显的伪影。为了解决这些问题,我们引入了网格和3D高斯的混合表示。我们的混合表示将每个3D高斯视为表面上的一个顶点,并按照SMPL-X的网格拓扑关系预定义连接信息(即三角面)在它们之间建立联系。这使得我们的ExAvatar能够在SMPL-X的面部表情空间驱动下进行具有新颖面部表情的动画。此外,通过使用基于连接的正则化器,我们显著减少了新颖面部表情和姿势中的伪影。
Moon等(周三)研究了这个问题。