Key points are not available for this paper at this time.
भाषा मॉडल (LMs) जैसे GPT-3, PaLM, और ChatGPT लगभग सभी प्रमुख भाषा प्रौद्योगिकियों की नींव हैं, लेकिन उनकी क्षमताएं, सीमाएं और जोखिम अच्छे से समझे नहीं गए हैं। हम भाषा मॉडलों (HELM) का समग्र मूल्यांकन प्रस्तुत करते हैं ताकि LMs की पारदर्शिता में सुधार हो सके। LMs कई उद्देश्यों की सेवा कर सकते हैं और उनके व्यवहार को कई इच्छाओं को पूरा करना चाहिए। संभावित परिदृश्यों और मेट्रिक्स की विशाल जगह को नेविगेट करने के लिए, हम स्थान का वर्गीकरण करते हैं और प्रतिनिधि उपसमुच्चय चुनते हैं। हम 16 मुख्य परिदृश्यों और 7 मेट्रिक्स पर मॉडलों का मूल्यांकन करते हैं, महत्वपूर्ण व्यापार संतुलनों को उजागर करते हैं। हम अपने मुख्य मूल्यांकन को सात लक्षित मूल्याकंन के साथ पूरक करते हैं ताकि विशिष्ट पहलुओं (जिनमें विश्व ज्ञान, तर्क, कॉपीराइटेड सामग्री का फिर से प्रस्तुतिकरण, और गलत सूचना का उत्पादन शामिल है) का गहराई से विश्लेषण किया जा सके। हम OpenAI, Microsoft, Google, Meta, Cohere, AI21 Labs, और अन्य से 30 LMs का मापदंड बनाते हैं। HELM से पहले, मॉडलों का सिर्फ 17.9% मुख्य HELM परिदृश्यों पर मूल्यांकन किया गया था, कुछ प्रमुख मॉडलों ने एक भी सामान्य परिदृश्य साझा नहीं किया। हम इसे 96.0% तक सुधारते हैं: अब सभी 30 मॉडल समान मानकीकृत स्थितियों के अंतर्गत मापदंडित हैं। हमारा मूल्यांकन 25 शीर्ष-स्तरीय निष्कर्षों को सामने लाता है। पूर्ण पारदर्शिता के लिए, हम सभी कच्चे मॉडल संकेत और पूर्णताएँ सार्वजनिक रूप से जारी करते हैं। HELM समुदाय के लिए एक जीवित मापदंड है, जिसे नए परिदृश्यों, मेट्रिक्स, और मॉडलों के साथ लगातार अपडेट किया जाता है https://crfm.stanford.edu/helm/latest/.
Bommasani et al. (Thu,) ने इस प्रश्न का अध्ययन किया।