Key points are not available for this paper at this time.
自己教師ありビデオ表現学習の要点は、ラベル付けされていないビデオから一般的な特徴を構築することです。しかし、最近のほとんどの研究は、高レベルの意味に主に焦点を当てており、一般的なビデオ理解に不可欠な低レベルの表現とそれらの時間的関係を無視しています。これらの課題に対処するために、本論文では、学習されたビデオ表現の一般化および時間的モデリング能力を改善するためのマルチレベル特徴最適化フレームワークを提案します。具体的には、ナイーブおよびプロトタイプによる対比学習から得られた高レベルの特徴を使用して分布グラフを構築し、低レベルおよび中レベルの特徴学習のプロセスを導きます。また、マルチレベルの特徴から動きパターン学習を強化するためのシンプルな時間的モデリングモジュールを考案します。実験では、グラフ制約と時間的モデリングを用いたマルチレベル特徴最適化が、ビデオ理解における表現能力を大幅に改善できることが示されています。コードはここで入手可能です。
Qian et al. (Fri,) はこの問題を研究しました。