बड़े भाषा मॉडल (LLMs) अक्सर गणितीय तर्क कार्यों के साथ संघर्ष करते हैं, जिन्हें सटीक, सत्यापनीय गणना की आवश्यकता होती है। जबकि परिणाम-आधारित पुरस्कारों से सुदृढीकरण शिक्षा (RL) पाठ-आधारित तर्क को बढ़ाती है, इस पर समझना कि एजेंट स्वतंत्र रूप से कोड निष्पादन जैसे बाहरी उपकरणों का लाभ कैसे उठाते हैं, महत्वपूर्ण है। हम उपकरण-संयुक्त तर्क के लिए परिणाम-आधारित पुरस्कारों से RL का अध्ययन करते हैं, ZeroTIR, बुनियादी LLMs को बिना निगरानी वाले उपकरण-उपयोग उदाहरणों के लिए गणितीय समस्याओं के लिए स्वाभाविक रूप से पायथन कोड उत्पन्न और निष्पादित करने के लिए प्रशिक्षित करते हैं। हमारा केंद्रीय योगदान यह है कि हम प्रदर्शित करते हैं कि जैसे-जैसे RL प्रशिक्षण आगे बढ़ता है, मुख्य मैट्रिक्स पूर्वानुमानित रूप से मापदंडित होते हैं। विशेष रूप से, हम मजबूत सकारात्मक सहसंबंधों को देखते हैं जहां बढ़ते प्रशिक्षण चरण स्वाभाविक कोड निष्पादन आवृत्तियों, औसत प्रतिक्रिया लंबाई, और, महत्वपूर्ण रूप से, अंतिम कार्य सटीकता में वृद्धि करते हैं। यह प्रशिक्षण में निवेश की गई गणनात्मक प्रयास और प्रभावी, उपकरण-सम्पन्न तर्क रणनीतियों के उभरने के बीच एक मात्रात्मक संबंध का सुझाव देता है। हम एक मजबूत ढांचा लागू करते हैं जिसमें एक अलग कोड निष्पादन वातावरण शामिल है और मानक RL एल्गोरिदम और ढांचों के बीच अपने निष्कर्षों को मान्य करते हैं। प्रयोग सिद्ध करते हैं कि ZeroTIR चुनौतीपूर्ण गणितीय बेंचमार्क पर गैर-उपकरण ZeroRL बेंचमार्क को महत्वपूर्ण रूप से पार करता है। हमारे निष्कर्ष यह समझने के लिए एक मौलिक आधार प्रदान करते हैं कि स्वतंत्र उपकरण उपयोग कैसे अधिग्रहित होता है और एजेंट RL के भीतर कैसे मापदंडित होता है, भविष्य के अध्ययनों के लिए एक पुनरुत्पादनीय बेंचमार्क पेश करता है। कोड https://github.com/yyht/openrlhfₐsyncₚipline पर जारी किया गया है।
मैई एट अल। (सोम,) ने इस प्रश्न का अध्ययन किया।