Key points are not available for this paper at this time.
نماذج اللغة (LMs) مثل GPT-3 و PaLM و ChatGPT تمثل الأساس لجميع تقنيات اللغة الرئيسية تقريبًا، لكن قدراتها وقيودها ومخاطرها ليست مفهومة جيدًا. نقدم هنا التقييم الشامل لنماذج اللغة (HELM) لتحسين الشفافية لنماذج اللغة. يمكن أن تخدم نماذج اللغة العديد من الأغراض ويجب أن يتوافق سلوكها مع العديد من المتطلبات. للتنقل في المساحة الواسعة من السيناريوهات والمعايير المحتملة، قمنا بتصنيف المساحة واختيار مجموعات تمثيلية. نقوم بتقييم النماذج على 16 سيناريو أساسي و7 معايير، مما يكشف عن التبادلات المهمة. نكمل تقييمنا الأساسي بسبعة تقييمات مستهدفة لتحليل جوانب محددة بعمق (بما في ذلك المعرفة العالمية، والتفكير، واسترجاع المحتوى المحمي بحقوق الطبع والنشر، وتوليد المعلومات المضللة). نقوم بتقييم 30 نموذج لغة، من OpenAI وMicrosoft وGoogle وMeta وCohere وAI21 Labs وغيرهم. قبل HELM، تم تقييم النماذج على 17.9% فقط من السيناريوهات الأساسية لـ HELM، حيث لم تتشارك بعض النماذج البارزة في أي سيناريو مشترك. نحن نحسن هذا إلى 96.0%: حيث يتم الآن تقييم جميع النماذج الثلاثين تحت نفس الظروف القياسية. تكشف تقييماتنا عن 25 نتيجة رئيسية. من أجل الشفافية الكاملة، نقوم بإصدار جميع مطالب وإكمالات النماذج بشكل علني. HELM هو معيار حي للمجتمع، يتم تحديثه باستمرار مع سيناريوهات ومعايير ونماذج جديدة https://crfm.stanford.edu/helm/latest/.
درس بومساني وآخرون (الخميس) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: