Key points are not available for this paper at this time.
मानव फीडबैक से सुदृढीकरण शिक्षण (RLHF) को सामान्यतः बड़े भाषा मॉडलों (LLMs) के व्यवहारों को मानव प्राथमिकताओं के साथ संरेखित करने के लिए उपयोग किया गया है। हाल ही में, एक लोकप्रिय विकल्प प्रत्यक्ष नीति अनुकूलन (DPO) है, जो LLM-आधारित इनाम मॉडल के स्थान पर नीति को स्वयं रखती है, इस प्रकार इनाम मॉडल को सीखने के लिए अतिरिक्त मेमोरी और प्रशिक्षण समय की आवश्यकता को समाप्त करती है। हालाँकि, DPO सकारात्मक और नकारात्मक प्रतिक्रियाओं की सापेक्ष गुणवत्ता पर विचार नहीं करता है, और यह उप-ऑप्टिमल प्रशिक्षण परिणामों की ओर ले जा सकता है। इस समस्या को हल करने के लिए, हम ऑन-दे-फ्लाई फाइन-ट्यूनिंग LLM के भीतर अंतर्निहित ज्ञान का उपयोग करके सापेक्ष गुणवत्ता प्राप्त करने और हानि फ़ंक्शन को परिष्कृत करने की जांच करते हैं। विशेष रूप से, हम सकारात्मक और नकारात्मक प्रतिक्रियाओं की गुणवत्ता का अनुमान लगाने के लिए एक सुधार फ़ंक्शन डिज़ाइन करने के लिए LLM ज्ञान का उपयोग करते हैं। हम दिखाते हैं कि निर्मित सुधार फ़ंक्शन हल्के मान्यताओं के तहत हानि फ़ंक्शन को आत्म-सुधार करने में मदद कर सकता है। सुधार फ़ंक्शन को DPO और इसके भिन्नता पहचान नीति अनुकूलन (IPO) में एकीकृत किया गया है। विभिन्न मूल्यांकनकर्ताओं के बीच प्रयोग दर्शाते हैं कि वे DPO और IPO पर फाइन-ट्यून किए गए मॉडलों के प्रदर्शन में सुधार कर सकते हैं।
यु एट अल। (शुक्र,) ने इस प्रश्न का अध्ययन किया।
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: