خدمة نماذج اللغة الكبيرة (LLMs) مكلفة. ومع ذلك، يمكن أن تعالج تقنية تكميم الأوزان بعد التدريب هذه المشكلة من خلال ضغط أحجامها للذاكرة المحدودة وتوفير النطاق الترددي للتسريع. نظرًا لأن ليس كل أبعاد الوزن بنفس القدر من الأهمية، تعتمد هذه الطرق عادةً على مقياس الحساسية، الذي يشير إلى تأثير الأوزان على دالة الخسارة بشكل عنصري ويستخدم لتحضير الأوزان الأصلية لتكميم أفضل. في هذا العمل، نقوم بإجراء دراسة تجريبية حول دقة مقياس الحساسية، ونجد أن المقاييس الحالية المعتمدة على المشتقات وهسيان غير دقيقة للغاية: فهي تقدر تأثير التكميم على دالة الخسارة بأحجام مختلفة، ويعود ذلك بشكل رئيسي إلى نصف قطر التقارب الصغير للتقريب من الدرجة الثانية المحلي، والمشتقة وعبارة هيسيان في معادلة تايلور. للتعامل مع هذه المشكلة، نقترح التكامل بعد التكميم (PQI)، وهو مقياس دقيق لتقدير الحساسية اللاحقة بطريقة مفصلة. للاستفادة من هذا المقياس الدقيق، نقترح أيضاً ReQuant، وهو إطار بسيط ولكنه قوي يتكون بشكل أساسي من مكونين منفصلين كثيفين ونادرين: اختيار الشواذ ذاتياً وفصل الأوزان الهامة خطوة بخطوة. تظهر النتائج أن ReQuant يعزز طرق التكميم بعد التدريب الحالية، مع تحسين ملحوظ بمقدار 2.66 في دقة الضبابية على Llama 3.2 1B باستخدام QTIP.
درس هو وآخرون (الجمعة) هذا السؤال.