Key points are not available for this paper at this time.
सामान्य उद्देश्य वाले बड़े भाषा मॉडल (LLMs) जैसे GPT-4 ने व्यापक वेब सामग्री का उपयोग करके मशीन अनुवाद (MT) मेंRemarkable प्रगति की है। दूसरी ओर, अनुवाद-विशिष्ट LLMs को क्षेत्र-विशिष्ट एकल-भाषाई कॉर्पस पर पूर्व-प्रशिक्षण और मानव-चिन्हित अनुवाद डेटा के साथ बारीकी से ठीक करने द्वारा बनाया गया है। इसके बावजूद कि इन तरीकों की प्रदर्शन पहले से बेहतर है, ये या तो अभूतपूर्व स्तर की कंप्यूटिंग और डेटा की मांग करते हैं या महत्वपूर्ण मानव संपादन और एनोटेशन प्रयासों की आवश्यकता होती है। इस पत्र में, हम लैडर का विकास करते हैं, जो सामान्य LLMs के MT के प्रदर्शन को सुधारने के लिए एक नवीन मॉडल-एग्नोस्टिक और लागत-कुशल उपकरण है। लैडर को झूठे-सुधार तिकड़ियों पर प्रशिक्षित किया गया है, जिन्हें अतिरिक्त मानव लागत के बिना मौजूदा LLMs से आसानी से प्राप्त किया जा सकता है। प्रशिक्षण के दौरान, हम आसान से कठिन योजना के साथ एक गतिशील बारीकी से ठीक करने की रणनीति का प्रस्ताव करते हैं, जो धीरे-धीरे लैडर के सुधार प्रदर्शन में सुधार करता है। प्रशिक्षित लैडर किसी भी सामान्य उद्देश्य वाले LLMs के साथ बिना किसी रुकावट के एकीकृत किया जा सकता है ताकि उनके अनुवाद प्रदर्शन को बढ़ाया जा सके। Gemma-2B/7B का उपयोग करते हुए, लैडर-2B कच्चे अनुवादों को शीर्ष स्तरीय ओपन-सोर्स मॉडलों के स्तर तक ले जा सकता है (जैसे, BigTranslate-13B को +6.91 BLEU और +3.52 COMET के साथ सुधारना XX-En के लिए), और लैडर-7B और अधिक मॉडल प्रदर्शन को उन्नत कर सकता है ताकि यह वर्तमान में सबसे उन्नत GPT-4 के बराबर हो जाए। व्यापक अपूर्णता और विश्लेषण विविध सेटिंग्स में लैडर की प्रभावशीलता की पुष्टि करते हैं। हमारे कोड उपलब्ध है https://github.com/fzp0424/Ladder
फेंग एट अल. (शनिवार) ने इस प्रश्न का अध्ययन किया।