Key points are not available for this paper at this time.
在本文中,我们提出了一种重编程预训练音频驱动说话人脸合成模型以使其按文本驱动方式运行的方法。因此,我们可以轻松生成清晰表达所提供文本句子的面部视频,消除了音频驱动模型在每次推理时都需录制语音的必要性。为此,我们提议将输入文本嵌入到预训练音频驱动模型已学习的音频隐空间中,同时保留原始预训练模型的面部合成能力。具体而言,我们设计了一个文本到音频嵌入模块(Text-to-Audio Embedding Module, TAEM),该模块通过对发音和时长特征进行建模,将给定的文本输入映射到音频隐空间中。此外,为了在使用文本输入的同时兼顾音频中的说话人特征,TAEM被设计为可接收视觉说话人嵌入。视觉说话人嵌入来源于单张目标人脸图像,并通过融合音频固有的说话人特征,实现了输入文本到已学习音频隐空间更优的映射。所提出框架的主要优势在于:1)可应用于多种不同的音频驱动说话人脸合成模型;2)能够以高度的灵活性利用文本输入或音频输入生成说话人脸视频。
Choi et al. (Mon,) 研究了这一问题。