Key points are not available for this paper at this time.
深層学習に基づくインテリジェントな画像処理は、次世代のコンピュータシステムにおいて重要な最近の人工知能手法です。画像処理を用いたキースピーカー検出は、複雑な多人数シーンにおいて最も重要な役割を果たすスピーカーを見つけることを目的としています。しかし、既存のスピーカー検出手法は、単に誰かが話しているかどうかを判断するだけです。この問題を克服するために、本論文ではSpeaker Pose-Attention deteCtion modEl(SPACE)という新しいキースピーカー検出アプローチを提案します。このアプローチは、空間情報を抽出し、人々の注意の集まりを分析してキースピーカーを見つけます。この方法は大きく二つの部分から構成されています。第一の部分は、重要なスピーカーの候補を見つけるために人間の姿勢推定と効果的な評価戦略を使用した重要性検出モデル(IDM)です。第二の部分は、姿勢注意グラフ(PAG)とリンク分析アルゴリズムから成り立っています。PAGは人々の注意グラフを表しています。リンク分析アルゴリズムは、このグラフの接続性を分析してキースピーカーを見つけ出します。利用可能なキースピーカー検出データセットが不足しているため、スピーチと会議シーンを含む自己収集データセットが構築され、SPACEモデルの推定に利用されました。実験結果は、提案された方法が他の既存の手法と比較して最高の検出精度を得ることができることを示しています。
Zhao et al. (Sat,) はこの問題を研究しました。