Key points are not available for this paper at this time.
人間の活動は特定のシーンコンテクストで行われることが多い(例:バスケットボールコートでのバスケットボールのプレイ)。したがって、既存のビデオデータセットを使用してモデルをトレーニングすることは、実際の識別的手がかりではなく、そのようなバイアスを捕捉し利用することを避けられない。学習された表現は、新しいアクションクラスや異なるタスクにうまく一般化しない可能性がある。本論文では、ビデオ表現学習におけるシーンバイアスを軽減することを提案する。具体的には、アクション分類のための標準交差エントロピー損失を 1) シーンタイプに対する敵対的損失と 2) 人間のアクターがマスクされたビデオ用の人間マスク混乱損失で強化する。これら2つの損失は、証拠がない場合にシーンタイプや正しいアクションを予測できない表現の学習を促進する。我々の方法の効果を、アクション分類、時間的位置特定、空間-時間アクション検出を含む三つの異なるタスクにプリトレーニングしたモデルを転送することで検証する。結果は、デバイアス処理なしのベースラインモデルに対して一貫した改善を示した。
Choi et al. (水曜日) がこの問題を研究しました。