أظهرت التطورات الأخيرة في فك الشيفرة التجريبية تسريعًا كبيرًا عبر مجموعة واسعة من مهام نماذج اللغة الكبيرة (LLM). يعتمد فك الشيفرة التجريبية بشكل أساسي على التضحية بالتخصيصات الإضافية للذاكرة لإنتاج عدة رموز مرشحة، حيث يقود معدل القبول التسريع. ومع ذلك، فإن نشر فك الشيفرة التجريبية على الأجهزة المقيدة بالذاكرة، مثل وحدات معالجة الرسوميات المحمولة، لا يزال يمثل تحديًا كبيرًا في السيناريوهات الواقعية. في هذا العمل، نقدم محرك استدلال واعٍ للجهاز يسمى SpecMemo يمكنه التحكم بذكاء في تخصيصات الذاكرة على مستويات أكثر دقة لتمكين روبوتات الدردشة متعددة الأدوار مع فك الشيفرة التجريبية على مثل هذه الأجهزة ذات الذاكرة المحدودة. تعتمد منهجيتنا على النمذجة النظرية للأثر الذاكري لفك الشيفرة التجريبية لتحديد حد أدنى على ميزانية الذاكرة المطلوبة مع الاحتفاظ بالتسريع. يحقق SpecMemo توازنًا دقيقًا بين تقليل تخصيصات الذاكرة الزائدة للرموز المرشحة التي تم رفضها والحفاظ على مكاسب الأداء التنافسية من التكهن. الجدير بالذكر، من خلال إدارة الذاكرة لـ SpecMemo، نحتفظ بنسبة 96٪ من إجمالي الإنتاجية من فك الشيفرة التجريبية على MT-Bench، مع تقليل الذاكرة المستخدمة في التوليد بنسبة 65٪ على وحدة معالجة الرسوميات Nvidia Titan RTX الواحدة. نظرًا لوجود عدة وحدات معالجة رسومية مقيدة، نبني على الطرازات السابقة لفك الشيفرة التجريبية لتسهيل الاستدلال للنماذج الكبيرة من خلال توزيع نموذج Llama-2-70B-Chat، الذي نقدم عليه فك الشيفرة التجريبي المجمع الجديد لزيادة قابلية استخدام عدة وحدات معالجة رسومية صغيرة. تظهر هذه الإطار الجديد تسريعًا بمقدار 2x مقارنة بفك الشيفرة التقليدي والتجريبي الموزع مع النموذج الأساسي على ثمانية وحدات معالجة رسومية AMD MI250. علاوة على ذلك، فإن الإنتاجية الاستدلالية تزداد بشكل ملحوظ بمقدار 8x مع حجم دفعة 10. تسهم أعمالنا في تطبيقات LLM مدمجمة في البيئات المقيدة بالموارد، مما يوفر طريقة لنشر أسرع وأرخص لتطبيقات LLM الواقعية مع أداء قوي.
درس يلدريم وآخرون (الجمعة) هذا السؤال.