Key points are not available for this paper at this time.
私たちは、厳しい学術予算下での言語適応のためのLLMの継続的な事前トレーニングを調査します。これは、限られた期間に並行して使用できるGPUが少数しかない設定です。私たちは、Mistral-7Bをドイツ語またはアラビア語に適応させることに焦点を当て、この設定における効率と効果を改善するいくつかの技術を評価します。この厳しいコンピュート予算で適応させたドイツ語モデルは、ベースのMistral-7Bと比較して性能が劣りますが、アラビア語モデルは複数のベースラインを上回り、十分に代表されている言語に対して専門化のための継続的な事前トレーニングが常に有効ではないことを示しています。私たちの主な発見は、トレーニングの精度とトークナイザーのスワッピングに焦点を当てています。私たちの結果は、純粋なbfloat16トレーニングが混合精度トレーニングの実行可能な代替手段であり、少数のGPUを使用する場合、遥かに速いことを示しています。特化したトークナイザーへのスワッピングは、より効率的なトークン化を実現し、もともといくつかのドイツ語トークンを含む原本のトークナイザーと競合しますが、ドイツ語に対する性能を大幅に向上させることはありませんでした。コードとモデルの重みはGitHubで入手可能です。
Dobler et al. (Wed,) はこの問題を研究しました。