Key points are not available for this paper at this time.
グロッキングとは、機械学習モデルがオーバーフィッティングの後に長い期間にわたって一般化する現象であり、主にアルゴリズム的なタスクで観察され、研究されてきました。本論文では、クロスエントロピー損失の下で分類のためにディープニューラルネットワークを使用し、実世界のデータセットにおけるグロッキングを探求します。私たちは、重みのL₂ノルムがグロッキングの主な原因であるという一般的な仮説に挑戦し、重みのノルムの期待される範囲外でもグロッキングが発生することを示します。グロッキングをよりよく理解するために、3つの新しい進捗測定を紹介します:活性化スパース性、絶対重みエントロピー、および近似局所回路複雑性です。これらの測定は一般化に概念的に関連しており、重みのノルムと比較して、実世界のデータセットにおけるグロッキングとの相関が強いことを示しています。我々の発見は、重みのノルムが通常グロッキングや我々の進捗測定と相関しているかもしれませんが、因果関係はなく、私たちが提案する測定がグロッキングのダイナミクスをより良く理解する手助けをすることを示唆しています。
サトヴィク・ゴレッハ(火曜日)がこの問題を研究しました。