Key points are not available for this paper at this time.
بينما أظهرت نماذج اللغة الكبيرة (LLMs) قدرات ملحوظة، إلا أنها تعاني من استهلاك كبير للموارد وكمون كبير بسبب المعالجة التلقائية. في هذه الدراسة، نقدم فك التشفير المتوازي القابل للتكيف N-gram (ANPD)، وهو نهج مبتكر وغير فاقد يسرع الاستدلال عن طريق السماح بالتوليد المتزامن لعدة رموز. يتضمن ANPD نهجًا من مرحلتين: يبدأ بمرحلة مسودة سريعة تستخدم وحدة N-gram، التي تتكيف بناءً على السياق التفاعلي الحالي، تليها مرحلة تحقق، حيث يقوم LLM الأصلي بتقييم وتأكيد الرموز المقترحة. ونتيجة لذلك، يحافظ ANPD على سلامة مخرجات LLM الأصلية بينما يعزز سرعة المعالجة. نستفيد أيضًا من بنية متعددة المستويات لوحدة N-gram لتعزيز دقة المسودة الأولية، مما يؤدي بدوره إلى تقليل كمون الاستدلال. يلغي ANPD الحاجة إلى إعادة التدريب أو ذاكرة GPU إضافية، مما يجعله تحسينًا فعالًا وسهل الاستخدام. في تجاربنا، أظهرت نماذج مثل LLaMA ومتغيراتها الدقيقة تحسينات في السرعة تصل إلى 3.67x، مما يؤكد فعالية ANPD المقترح.
درس أو وزملاؤه (الأربعاء) هذا السؤال.