Key points are not available for this paper at this time.
感覚情報のマルチモーダルなストリームは、信号レベルの特徴抽出と高次の認知プロセスを用いて、人間によって自然に構文解析され統合されます。本研究では、ビデオストリームで伝達される音声、視覚、およびテキスト情報の顕著性モデルに基づいて、注意を喚起する視聴覚セグメントの検出を定式化します。聴覚的顕著性は、非線形演算子およびエネルギートラッキングによって抽出される、多周波波形変調を定量化する手がかりによって評価されます。視覚的顕著性は、輝度、色、および方位によって駆動される時空間注意モデルを通じて測定されます。テキスト的または言語的顕著性は、多くの映画配信で利用可能な字幕情報の品詞タグ付けから抽出されます。モダリティ依存の手がかりから得られた個々の顕著性ストリームは、合成ビデオストリームの時間変化する知覚的重要性をモデル化し、主要な感覚イベントを示すマルチモーダル顕著性曲線へと統合されます。このマルチモーダル顕著性表現は、汎用的なボトムアップ型ビデオ要約アルゴリズムの基盤を形成します。マルチモーダル顕著性アノテーションを持つ映画データベース上で様々な統合スキームが評価され、モダリティ間の比較結果が提示されます。低レベルの特徴量およびコンテンツ非依存の統合と選択に基づいて生成された要約は、主観的に高い美観と情報価値を備えています。
Evangelopoulos et al. (Fri,) がこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: