Key points are not available for this paper at this time.
以前のアニメーション技術は、主に明示的な構造表現(例えば、メッシュやキーポイント)を利用して、ドライブ動画からソース画像への動きを転送することに焦点を当てています。しかし、このような方法は、ソースデータとドライブデータ間の大きな外観変動によって課題に直面しており、外観と動きをそれぞれモデル化するために複雑な追加モジュールを必要とします。これらの問題に対処するために、我々は高解像度画像をアニメーション化するために洗練された潜在画像アニメーター(LIA)を導入します。LIAは明示的な表現に依存しないシンプルなオートエンコーダーとして設計されています。ピクセル空間における動きの転送は、潜在空間における動きコードの線形ナビゲーションとしてモデル化されます。具体的には、このナビゲーションは、提案された線形運動分解(LMD)に基づいて自己教師ありの方法で学習された直交運動辞書として表現されます。広範な実験結果は、LIAがVoxCeleb、TaichiHD、そしてTED-talkデータセットにおいて、ビデオ品質と時空間的一貫性に関して最先端技術を上回ることを示しています。さらに、LIAはゼロショット高解像度画像アニメーションに対応しています。コード、モデル、およびデモ動画は https://wyhsirius.github.io/LIA-project/ で入手できます。
Wang et al. (金曜日) はこの問題を研究しました。