Key points are not available for this paper at this time.
مؤخراً، أبدت مجتمع النماذج اللغوية الكبيرة (LLM) اهتماماً متزايداً في تعزيز قدرة النماذج على التعامل مع الوثائق الطويلة جداً. مع ظهور تقنيات نصوص طويلة وهياكل نموذجية متنوعة، أصبحت التقييمات الدقيقة والمفصلة لقدرات النماذج في التعامل مع النصوص الطويلة أكثر أهمية. المعايير الحالية لتقييم النصوص الطويلة، مثل L-Eval وLongBench، تبني مجموعات اختبار نصوص طويلة استناداً إلى مجموعات بيانات مفتوحة المصدر، مع التركيز بشكل رئيسي على مهام الأسئلة والأجوبة والتلخيص. تشمل هذه المجموعات عينات اختبار ذات أطوال متنوعة (من 2k إلى 32k+) متشابكة معاً، مما يجعل من الصعب تقييم قدرات النموذج عبر نطاقات الأطوال المختلفة. علاوة على ذلك، فهي لا تغطي الإعدادات الفائقة الطول (100k+ توكن) التي تدعي أحدث النماذج تحقيقها. في هذه الورقة، نقدم Ada-LEval، معياراً قابلاً للتكيف مع الطول لتقييم فهم السياق الطويل للنماذج اللغوية الكبيرة. تتضمن Ada-LEval مجموعتين فرعيتين تحديتين، TSort وBestAnswer، مما يمكّن من إجراء تقييم أكثر موثوقية لقدرات النماذج اللغوية الكبيرة في السياقات الطويلة. تدعم هذه المعايير التلاعب المعقد في طول حالات الاختبار، ويمكنها بسهولة إنتاج عينات نصية تصل إلى 128k توكن. نقوم بتقييم 4 نماذج API مغلقة المصدر وحديثة و6 نماذج مفتوحة المصدر باستخدام Ada-LEval. تظهر نتائج التقييم قيود النماذج الحالية، خاصة في الإعدادات ذات السياق الفائق الطول. الكود الخاص بنا متاح على https://github.com/open-compass/Ada-LEval.
درس وانغ وآخرون (الثلاثاء) هذا السؤال.