लोड असंतुलन मिश्रण-ऑफ-विशेषज्ञ (MoE) मॉडल के प्रशिक्षण में एक प्रमुख प्रदर्शन बाधा है, क्योंकि असंतुलित विशेषज्ञ लोड मार्गनिर्धारण गिरावट का कारण बन सकता है। अधिकांश मौजूदा दृष्टिकोण इस मुद्दे को लोड संतुलित करने के लिए सहायक हानि कार्यों को पेश करके संबोधित करते हैं; हालाँकि, इन हानि कार्यों के भीतर के हाइपरपैरामीटर्स अक्सर विभिन्न कार्यों के लिए समायोजित करने की आवश्यकता होती है। इसके अलावा, सक्रिय विशेषज्ञों की संख्या बढ़ाने से लोड असंतुलन बढ़ जाता है, जबकि सक्रियण संख्या को ठीक करने से मॉडल की कठिन कार्यों को संभालने की आत्मविश्वास कम हो सकता है। इन चुनौतियों का सामना करने के लिए, यह लेख एक गतिशील रूप से संतुलित मार्गनिर्धारण रणनीति का प्रस्ताव करता है जो एक सीमा-आधारित गतिशील मार्गनिर्धारण एल्गोरिदम का उपयोग करता है। प्रत्येक मार्गनिर्धारण चरण के बाद, यह विधि विशेषज्ञ भार को समायोजित करती है ताकि अगले मार्गनिर्धारण में लोड वितरण को प्रभावित किया जा सके। हानि-कार्य-आधारित संतुलन विधियों के विपरीत, हमारा दृष्टिकोण सीधे मार्गनिर्धारण स्तर पर कार्य करता है, ग्रेडिएंट परिवर्तन से बचकर जो मॉडल गुणवत्ता को कम कर सकता है, जबकि संगणन संसाधनों के अधिक कुशल उपयोग के लिए गतिशील रूप से मार्गनिर्धारण करता है। नैतिक भाषा समझ (NLU) मानकों पर प्रयोगों से पता चलता है कि प्रस्तावित विधि शीर्ष-2 मार्गनिर्धारण के बराबर सटीकता प्राप्त करती है, जबकि लोड मानक विचलन को महत्वपूर्ण रूप से कम करती है (जैसे, MNLI पर 12.25 से 1.18 तक)। इसके अलावा, सीमा-आधारित गतिशील विशेषज्ञ सक्रियण मॉडल के पैरामीटर को कम करता है और विशेषज्ञों के बीच लोड असंतुलन को कम करने के लिए एक नया दृष्टिकोण प्रस्तुत करता है।
Wen et al. (मंगलवार,) ने इस प्रश्न का अध्ययन किया।