Key points are not available for this paper at this time.
فهم كيف يتغير أداء نماذج اللغة مع المقياس أمر حاسم لتقييم الأداء وتطوير الخوارزميات. قوانين القياس هي أحد الأساليب لبناء هذا الفهم، لكن شرط تدريب النماذج عبر العديد من المقاييس المختلفة قد حد من استخدامها. نقترح نهجاً بديلاً ملاحظياً يتجاوز تدريب النماذج ويقوم بدلاً من ذلك ببناء قوانين القياس من حوالي 80 نموذجاً متاحاً للجمهور. بناء قانون قياس واحد من عدة عائلات نماذج يمثل تحدياً بسبب الاختلافات الكبيرة في كفاءات الحساب أثناء التدريب والقدرات. ومع ذلك، نظهر أن هذه الاختلافات متوافقة مع قانون قياس بسيط ومعمم حيث يعتبر أداء نموذج اللغة تابعاً لمساحة قدرات منخفضة الأبعاد، وتختلف عائلات النماذج فقط في كفاءتها في تحويل الحسابات التدريبية إلى قدرات. باستخدام هذا النهج، نوضح القابلية المدهشة للتنبؤ بالظواهر المعقدة للقياس: نوضح أن عدة ظواهر ناشئة تتبع سلوكاً سلساً، سيغمويدياً وقابل للتنبؤ من نماذج صغيرة؛ نوضح أن أداء الوكيل لنماذج مثل GPT-4 يمكن التنبؤ به بدقة من نقاط مرجعية أبسط غير وكيلية؛ ونوضح كيف يمكن التنبؤ بتأثير التدخلات بعد التدريب مثل سلسلة الأفكار والاتساق الذاتي مع استمرار تحسين قدرات نماذج اللغة.
درس رويان وآخرون (الجمعة) هذا السؤال.