Key points are not available for this paper at this time.
बड़े भाषा मॉडल (LLMs) सर्वव्यापी हैं, हालाँकि उनकी व्यावहारिक तैनाती चुनौतीपूर्ण है क्योंकि उनकी गणनात्मक और मेमोरी की मांगें लगातार बढ़ रही हैं। क्वांटाइजेशन उन्हें अधिक गणना और मेमोरी प्रभावी बनाने के सबसे प्रभावी तरीकों में से एक है। क्वांटाइजेशन-जानकारी प्रशिक्षण (QAT) विधियाँ आमतौर पर सबसे अच्छा क्वांटाइज्ड प्रदर्शन उत्पन्न करती हैं, हालाँकि यह संभावित रूप से लंबे प्रशिक्षण समय और अत्यधिक मेमोरी उपयोग की कीमत पर आता है, जिससे LLMs पर लागू करने पर यह अप्रैक्टिकल हो जाता है। पैरामीटर-कुशल फाइन-ट्यूनिंग (PEFT) और कम-रैंक अनुकूलन (LoRA) साहित्य से प्रेरित होकर, हम LR-QAT का प्रस्ताव करते हैं - LLMs के लिए एक हल्का और मेमोरी-कुशल QAT एल्गोरिदम। LR-QAT कई घटकों का उपयोग करता है ताकि पूर्वानुमानात्मक प्रदर्शन को त्यागे बिना मेमोरी को बचाया जा सके: (क) कम-रैंक सहायक भार जो क्वांटाइजेशन ग्रिड के प्रति जागरूक हैं; (ख) निश्चित-बिंदु या डबल-पैक्ड पूर्णांकों का उपयोग करते हुए एक डाउनकास्टिंग ऑपरेटर और (ग) चेकपॉइंटिंग। अधिकांश संबंधित कार्यों के विपरीत, हमारी विधि (i) अनुमान में कुशल है, जो पारंपरिक PTQ की तुलना में कोई अतिरिक्त ओवरहेड नहीं लाती; (ii) इसे एक सामान्य विस्तारित पूर्व-प्रशिक्षण ढांचे के रूप में देखा जा सकता है, अर्थात् परिणामस्वरूप मॉडल को बाद में किसी भी डाउनस्ट्रीम कार्य के लिए उपयोग किया जा सकता है; (iii) इसे विभिन्न क्वांटाइजेशन सेटिंग्स में लागू किया जा सकता है, जैसे कि क्वांटाइजेशन ग्रेन्युलैरिटी के विभिन्न विकल्प, सक्रियण क्वांटाइजेशन, और कई PTQ तकनीकों के साथ सहजता से मिलाया जा सकता है। हम LR-QAT को LLaMA-2/3 और Mistral मॉडल परिवारों पर लागू करते हैं और कई डाउनस्ट्रीम कार्यों पर इसकी प्रभावशीलता की पुष्टि करते हैं। हमारी विधि सामान्य पोस्ट-प्रशिक्षण क्वांटाइजेशन (PTQ) दृष्टिकोणों को पार करती है और इसकी मेमोरी उपयोग के एक अंश पर पूर्ण-मॉडल QAT के समान मॉडल प्रदर्शन तक पहुँचती है। विशेष रूप से, हम 24GB मेमोरी के साथ एकल उपभोक्ता ग्रेड GPU पर 7B LLM को प्रशिक्षित कर सकते हैं।
बॉन्डारेन्को एट अल। (सोम,) ने इस प्रश्न का अध्ययन किया।
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: