Key points are not available for this paper at this time.
C3LLM(条件付き三モダリティ大規模言語モデル)を紹介します。これは、ビデオからオーディオ、オーディオからテキスト、テキストからオーディオの3つのタスクを組み合わせた新しいフレームワークです。C3LLMは、大規模言語モデル(LLM)の構造を異なるモダリティを整合させ、与えられた条件情報を合成し、離散的にマルチモーダル生成を行うための橋として適用します。私たちの貢献は次のとおりです。まず、事前に訓練されたオーディオコードブックを用いて、オーディオ生成タスクのために階層構造を適応します。具体的には、与えられた条件からオーディオセマンティックトークンを生成するためにLLMを訓練し、さらにレイヤー内で異なるレベルの音響トークンを生成するために非自己回帰型トランスフォーマーを使用して、生成されたオーディオの忠実性を向上させます。次に、LLMが元々次の単語予測方法で離散タスクのために設計されたという直感に基づき、オーディオ生成のために離散表現を使用し、セマンティックな意味を音響トークンに圧縮します。これは、LLMに「音響語彙」を追加することに似ています。三つ目に、私たちの方法は以前のオーディオ理解、ビデオからオーディオ生成、テキストからオーディオ生成のタスクを1つの統合モデルにまとめ、エンドツーエンドの方法でより柔軟性を提供します。私たちのC3LLMは、さまざまな自動評価メトリックを通じて改善された結果を達成し、以前の方法と比較してより良いセマンティック整合性を提供します。
Wang et al. (Sat,) はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: