我々は、拡散モデルが複雑な分布をモデル化する上で成功している理由の大部分は、その入力条件付けから来ていると主張します。本論文では、理想的な表現はサンプルの忠実度を向上させ、生成が容易であり、訓練外のサンプル生成を可能にするための構成的であるべきだという観点から、拡散モデルの条件付けに使用される表現を調査します。我々は、自己監視学習の目的で訓練された単純多面体埋め込みから派生した画像表現である離散潜在コード(DLC)を導入します。DLCは離散トークンのシーケンスであり、標準的な連続画像埋め込みとは異なります。これらは生成が容易で、構成性は訓練分布を超えた新しい画像のサンプリングを可能にします。DLCを使用して訓練された拡散モデルは生成の忠実度が向上し、ImageNetにおける無条件画像生成の新しい最先端を確立します。さらに、DLCを組み合わせることで、画像生成器が多様な方法で画像の意味を一貫して組み合わせた訓練分布外のサンプルを生成できることを示します。最後に、DLCが大規模な事前学習された言語モデルを活用することでテキストから画像の生成を可能にする方法を示します。テキスト拡散言語モデルを効率的にファインチューニングし、画像生成器の訓練分布外の新しいサンプルを生成するDLCを生成します。
Lavoie et al. (2025) はこの問題を調査しました。