Key points are not available for this paper at this time.
尽管文本到动作合成取得了显著进展,在3D环境中生成语言引导的人类动作仍然面临重大挑战。这些挑战主要源于(i)缺乏强大的生成模型,无法共同建模自然语言、3D场景和人类动作,以及(ii)生成模型对数据的高需求与全面、高质量的语言场景动作数据集的稀缺之间的对比。为了应对这些问题,我们提出了一种新颖的两阶段框架,利用场景可供性作为中间表示,有效地链接3D场景基础和条件动作生成。我们的框架包括一个可供性扩散模型(ADM),用于预测显式可供性图,以及一个可供性到动作扩散模型(AMDM),用于生成合理的人类动作。通过利用场景可供性图,我们的方法克服了在多模态条件信号下生成人体动作的困难,特别是在训练数据有限且缺乏广泛的语言场景动作对时。我们 extensive experiments表明,我们的方法在已建立的基准上,如HumanML3D和HUMANISE,始终优于所有基线。此外,我们验证了模型在经过特别策划的评估集上的卓越泛化能力,该评估集包含之前未见过的描述和场景.
王等(Sun)研究了这个问题。