Key points are not available for this paper at this time.
言語モデルのトレーニングはスケールに伴い、ますます費用がかかるようになり、最適化効率を向上させるための多くの試みが行われています。これらの努力にもかかわらず、Adamオプティマイザーは最も効果的なアプローチであるという見解から、最も広く使用されています。我々は、自回帰型言語モデルの文脈において、SGD、Adafactor、Adam、Lionなどの複数の最適化アルゴリズムをモデルのサイズ、ハイパーパラメーター、およびアーキテクチャのバリエーションにわたって比較することを目指します。我々の発見は、SGDを除いて、これらのアルゴリズムはその最適な性能においても、広範なハイパーパラメーター選択においても同様にパフォーマンスを発揮することを示しています。我々の結果は、実務者に対して、最適化手法の選択はメモリ制約や実装の容易さといった実践的な考慮によって導かれる可能性があることを示唆しています。なぜなら、性能やハイパーパラメーターの誤特定に対する安定性の観点から明確な勝者として浮かび上がるアルゴリズムが存在しなかったからです。我々の発見を踏まえ、これらのアプローチをさらに細分化し、Adamの2つの簡略化バージョンを検討します。a) サインモーメント(Signum)は、Adamの性能とハイパーパラメーターの安定性を回復することが見られ、b) Adalayerは、Adamの前処理を研究するために導入した層ごとのバリエーションです。Adalayerを検討することで、Adamの前処理の最大の影響は最後の層とLayerNormパラメーターに制限され、驚くことに残りの層はSGDでトレーニングできるという結論に至ります。
Zhaoら(Wed,)はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: