Key points are not available for this paper at this time.
マルチモーダル関係抽出(MRE)に関する既存の研究は、内部情報の過剰利用と外部情報の過少利用という2つの共存する課題に直面しています。これに対抗するため、内部情報のスクリーニングと外部情報の活用を同時に実装する新しいフレームワークを提案します。まず、入力画像とテキストの詳細な意味構造を視覚的およびテキストのシーングラフで表現し、さらに統合されたクロスモーダルグラフ(CMG)に融合します。CMGに基づいて、グラフ情報ボトルネック原則に従って構造の洗練を行い、情報量の少ない特徴を積極的に除去します。次に、入力画像とテキストに対してトピックモデリングを行い、潜在的マルチモーダルトピック特徴を取り入れて文脈を豊かにします。ベンチマークのMREデータセットで、我々のシステムは現在の最良モデルを大幅に上回ります。さらに詳しい分析を通じて、私たちの手法がMREタスクにおいて大きな可能性を持つことを明らかにします。
Wu et al. (Sun,) はこの問いを研究しました。