Key points are not available for this paper at this time.
कई अध्ययनों ने दिखाया है कि बड़े भाषा मॉडल (LLMs) विभिन्न संदर्भीय स्थितियों के प्रति असमान जागरूकता प्रदर्शित करते हैं। उनकी सीमित संदर्भ जागरूकता महत्वपूर्ण जानकारी की अनदेखी करने और इसके परिणामस्वरूप कार्य विफलताओं की ओर ले जा सकती है। जबकि LLMs की संदर्भ जागरूकता बढ़ाने के लिए कई दृष्टिकोण प्रस्तावित किए गए हैं, प्रभावशीलता और दक्षता दोनों को प्राप्त करना चुनौतीपूर्ण बना हुआ है। इस पत्र में, हम LLMs के लिए एक नवीन विधि प्रस्तुत करते हैं जिसे ``संदर्भ विशेषज्ञों का मिश्रण'' (MoICE) कहा जाता है, जो इस चुनौती का समाधान करने के लिए RoPE को स्थिति एम्बेडिंग के रूप में उपयोग करता है। MoICE में दो प्रमुख घटक शामिल हैं: प्रत्येक ध्यान सिर में एक राउटर जोड़ा गया है और एक हल्का राउटर-केवल प्रशिक्षण अनुकूलन रणनीति: (1) MoICE प्रत्येक RoPE कोण को एक 'संदर्भ में' विशेषज्ञ के रूप में देखता है, जो एक सिर के ध्यान को विशिष्ट संदर्भीय स्थितियों की ओर निर्देशित करने में सक्षम दिखाया गया है। नतीजतन, प्रत्येक ध्यान सिर राउटर द्वारा गतिशील रूप से चयनित कई RoPE कोणों का उपयोग करके लचीले ढंग से टोकन संसाधित करता है ताकि आवश्यक स्थितियों पर ध्यान दिया जा सके। यह दृष्टिकोण आवश्यक संदर्भ जानकारी की अनदेखी करने के जोखिम को कम करता है। (2) राउटर-केवल प्रशिक्षण रणनीति में LLM पैरामीटर को फ्रीज करना और केवल कुछ चरणों के लिए राउटर को विशेष रूप से अपडेट करना शामिल है। जब इसे ओपन-सोर्स LLMs जैसे Llama और Mistral पर लागू किया जाता है, तो MoICE लंबी संदर्भ समझ और निर्माण पर कई कार्यों में पूर्ववर्ती तरीकों को पार करता है, सभी को श्रेयपात्र अनुमान दक्षता बनाए रखते हुए।
लिन एट अल। (2024) ने इस प्रश्न का अध्ययन किया।