Key points are not available for this paper at this time.
最近の言語の基盤モデルに関する調査では、言語と知覚の全体的な見方が独立した見方よりも高いパフォーマンスを提供できることが示されています。本研究では、Latent Dirichlet Allocationの二次元多モーダル版をさまざまな方法で改善します。(1) テキストのみのモデルよりも二つの異なる評価で優れた性能を発揮し、低レベルの視覚的特徴が既存モデルと直接互換性があることを実証します。(2) 画像の非監視クラスタを使用して、LDAモデルに視覚的特徴を統合する新しい方法を提示します。クラスタは直接解釈可能で、評価タスクを改善します。(3) ビモーダルモデルを三つ以上のモダリティに拡張する二つの新しい方法を提供します。三次元、四次元、五次元のモデルは、一つまたは二つのモダリティのみを使用するモデルと比較して顕著に優れた性能を発揮し、非テキストのモダリティはそれぞれ共有の潜在構造に強制できない別個の知識を提供します。
ロラーら(火曜日)はこの問題を研究しました。