Key points are not available for this paper at this time.
トーキングフェイス生成の重要な要素として、唇の動き生成は生成されたトーキングフェイスビデオの自然さと一貫性を決定します。従来の文献は主に音声から唇への生成に焦点を合わせている一方で、テキストから唇(T2L)の生成はほとんど行われていません。T2Lは挑戦的なタスクであり、既存のエンドツーエンドの手法は注意メカニズムと自回帰(AR)デコーディング方式に依存しています。しかし、ARデコーディング方式では、現在の唇フレームが以前に生成されたフレームに基づいて生成されるため、推論速度を本質的に制約し、エラー伝播により生成された唇フレームの品質にも悪影響を及ぼします。これにより、平行T2L生成の研究が奨励されます。本研究では、高速かつ高忠実度のテキストから唇生成(ParaLip)のための平行デコーディングモデルを提案します。具体的には、エンコードされた言語特徴の持続時間を予測し、持続時間を考慮して非自回帰的手法でターゲット唇フレームをモデル化します。さらに、生成された唇フレームの知覚的品質を改善し、ぼやけた予測問題を軽減するために、構造類似性インデックス損失および敵対的学習を組み込みます。GRIDおよびTCD-TIMITデータセットで実施した広範な実験により、提案手法の優位性が示されました。
Liu et al. (Tue,) はこの問題を研究しました。
Synapse has enriched one closely related paper. Consider it for comparative context: