أصبح التعلم من خلال التغذية الراجعة البشرية (RLHF) نهجًا سائدًا لمواءمة مخرجات نماذج اللغة الكبيرة مع تفضيلات البشر. مستلهمين من نجاح RLHF، ندرس أداء عدة خوارزميات تتعلم من التغذية الراجعة (تكرار الخبراء، تحسين السياسة القريب (PPO)، التعزيز الشرطي للعودة) من أجل تحسين قدرات التفكير في نماذج اللغة الكبيرة. نحقق كل من المكافآت المتناثرة والكثيفة المقدمة لنموذج اللغة الكبيرة بشكل تجريبي ومن خلال نموذج مكافأة متعلم. نبدأ أيضًا من أحجام نماذج متعددة وتدريبات أولية مع وبدون بيانات التدريب الخاضعة للإشراف. بشكل عام، نجد أن جميع الخوارزميات تؤدي بشكل متقارب، حيث أن تكرار الخبراء يؤدي أفضل في معظم الحالات. من المدهش أننا نجد أن تعقيد العينة لتكرار الخبراء مشابه لذلك لـ PPO، حيث يتطلب على الأكثر حوالي 10⁶ عينة للتقارب من نقطة تفتيش مدربة مسبقًا. نستكشف لماذا يحدث ذلك، ونستنتج أنه خلال تدريب RL تفشل النماذج في الاستكشاف بشكل كبير خارج الحلول التي أنتجتها نماذج SFT. بالإضافة إلى ذلك، نناقش وجود تعارض بين أداء قياسات maj@1 و pass@96 خلال تدريب SFT وكيف أن تدريب RL يحسن كلاهما في نفس الوقت. ثم نختم بمناقشة تداعيات نتائجنا لـ RLHF والدور المستقبلي للتعزيز العلوي في تحسين نماذج اللغة الكبيرة.
دراسة هافريلا وآخرون (2024) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: