Key points are not available for this paper at this time.
نستكشف الحجم الأمثل للنموذج وعدد الرموز لتدريب نموذج اللغة المحول ضمن ميزانية حسابية معينة. نجد أن النماذج الكبيرة الحالية للغة لم تُدرب بشكل كافٍ، وهو نتيجة للتركيز الأخير على توسيع نماذج اللغة مع الحفاظ على كمية بيانات التدريب ثابتة. من خلال تدريب أكثر من 400 نموذج لغة تتراوح من 70 مليون إلى أكثر من 16 مليار معلمة على ما بين 5 إلى 500 مليار رمز، نجد أنه للتدريب الأمثل حسابيًا، يجب أن يكون حجم النموذج وعدد رموز التدريب متناسبين بشكل متساوٍ: فعند مضاعفة حجم النموذج، يجب أيضًا مضاعفة عدد رموز التدريب. نختبر هذه الفرضية من خلال تدريب نموذج متوقع مثالي حسابيًا، Chinchilla، الذي يستخدم نفس ميزانية الحساب مثل Gopher ولكن مع 70B معلمة وبيانات إضافية أكثر. يتفوق Chinchilla بشكل موحد ومهم على Gopher (280B) وGPT-3 (175B) وJurassic-1 (178B) وMegatron-Turing NLG (530B) في مجموعة واسعة من مهام التقييم التالية. وهذا يعني أيضًا أن Chinchilla يستخدم حسابًا أقل بكثير للتعديل الدقيق والاستدلال، مما يسهل الاستخدام التالي. كأحد أبرز النتائج، يصل Chinchilla إلى دقة متوسطة رائدة تبلغ 67.5% في معيار MMLU، مما يمثل تحسنًا يزيد عن 7% مقارنة بـGopher.
دstudied Hoffmann et al. (Tue,) هذا السؤال.