Key points are not available for this paper at this time.
لقد غيرت نماذج اللغة الكبيرة (LLMs) paradigm معالجة بيانات اللغة الطبيعية. ومع ذلك، يمكن أن تؤدي خصائصها الغامضة والاحتمالية إلى مخاطر محتملة في جودة المخرجات في تطبيقات LLM المختلفة. لقد اختبرت الدراسات الأخيرة خصائص الجودة (QAs)، مثل المتانة أو العدالة، لنماذج LLM من خلال إنتاج نصوص إدخال معادية. ومع ذلك، قامت الدراسات الموجودة بتقييد تغطيتها لـ QAs والمهام في LLMs ويصعب توسيعها. بالإضافة إلى ذلك، استخدمت هذه الدراسات مقياس تقييم واحد فقط، معدل نجاح الهجوم (ASR)، لتقييم فعالية أساليبها. نقترح إطار اختبار التحولات لتحليل LLMs (METAL) لمعالجة هذه المشكلات من خلال تطبيق تقنيات الاختبار التحولي (MT). يسهل هذا النهج اختبار خصائص LLM بطريقة منظمة من خلال تعريف علاقات التحول (MRs)، التي تعمل كمقاييس تقييم مُجزأة. يمكن لإطار METAL توليد مئات من MRs تلقائيًا من قوالب تغطي أنواع QAs ومهام مختلفة. بالإضافة إلى ذلك، قدمنا مقاييس جديدة لتقييم فعالية MRs بدقة من خلال دمج طريقة ASR في الخصائص الدلالية للنص. من خلال التجارب التي أُجريت مع ثلاثة من نماذج LLM البارزة، أكدنا أن إطار METAL يقيم بفعالية QAs الأساسية في المهام الرئيسية لنماذج LLM ويكشف عن مخاطر الجودة في LLMs. علاوة على ذلك، يمكن أن توجه المقاييس الجديدة المقترحة MRs المثلى لاختبار كل مهمة وتقترح الطريقة الأكثر فعالية لتوليد MRs.
درَس هيون وآخرون (Mon،) هذا السؤال.