Key points are not available for this paper at this time.
イベントコリファレンス解決 (ECR) は、マルチドキュメントコーパス内のイベントの異なる言及が実際に同じ基礎的な発生にリンクしているかどうかを判断するタスクです。イベントの画像は、言語があいまいな場合に解決を促進するのに役立ちます。ここでは、視覚およびテキストの手がかりを統合し、ビジョンとラングエージモデルの間の単純な線形マップを使用したマルチモーダルクロスドキュメントイベントコリファレンス解決法を提案します。既存のECRベンチマークデータセットは、すべてのイベントの言及に対して画像を提供することはまれなため、インターネットから収集したイベント中心の画像および画像拡散モデルを使用して生成した画像で、人気のあるECB+データセットを強化します。画像とテキストをコリファレンスに組み込む3つの方法を確立します:1)ファインチューニングを伴う標準的な融合モデル、2)ファインチューニングなしの新しい線形マッピング手法、3)意味的および談話レベルの難易度によって言及ペアを分割する基づいたアンサンブリングアプローチです。拡張されたECB+とAIDAフェーズ1の2つのデータセットで評価します。クロスモーダル線形マッピングを使用した私たちのアンサンブルシステムは、使用した前処理の仮定に基づいてECRのパフォーマンスに対して上限(91.9 CoNLL F1)を確立し、AIDAフェーズ1での新しいベースラインを確立します。私たちの結果は、特定の困難なコリファレンス問題におけるECRにおけるマルチモーダル情報の有用性を示し、コリファレンス解決の分野におけるより多くのマルチモーダルリソースの必要性を浮き彫りにしています。
Nath et al. (Sat,) はこの質問を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: