الملخص: نماذج اللغة الكبيرة (LLMs) المدربة مسبقًا على مجموعات بيانات موجهة نحو اللغة الإنجليزية لديها تحيزات وتؤدي بفعالية أقل على لغات طبيعية أخرى. يوفر تكييف مفردات LLMs وسيلة فعالة من حيث الموارد لتحسين جودة النموذج المدرب مسبقًا. تركز تقنيات التكيف المقترحة سابقًا على الأداء (الدقة) ومقاييس الحجم (الخصوبة)، متجاهلة جوانب أخرى بالمقارنة، مثل زمن استنتاج، موارد الحساب لتكييف، والنسيان الكارثي. يسد هذا البحث هذه الفجوة من خلال إجراء مقارنة متعددة الجوانب لعدة تقنيات لتكييف وحدات التشفير لنموذج LLM قائم على وحدة فك التشفير ثابتة. في تجاربنا، نركز فقط على اللغة الروسية من أجل وضوح النتائج في ظروف الموارد المحدودة. تحت ظروف مراقبة، نقوم بمقارنة ثلاث طرق. establishes New Baselines لتكييف وحدات التشفير باللغة الروسية ويظهر وسيلة فعالة من حيث الحساب لتعزيز الأداء، مما يقلل ساعات GPU حتى 2-3 مرات.
درس أندريوشينكو وآخرون (الأربعاء) هذا السؤال.