इस अनुप्रयोगीय अध्ययन में 21 LLMs का उपयोग किया गया, अग्रणी LLMs ने अंतिम निदानों पर उच्च सटीकता प्राप्त की, लेकिन भिन्नात्मक निदानों का उत्पन्न करने और अन्य तर्क स्तरों की तुलना में अनिश्चितता को संभालने में खराब प्रदर्शन किया। PrIME-LLM फ्रेमवर्क ने कच्ची सटीकता की तुलना में अधिक भिन्नता प्रदान की, पारंपरिक मानकों द्वारा छिपाए गए महत्वपूर्ण तर्क अंतरालों को प्रकट किया। इसलिए, संस्करण आधारित सुधार और तर्क-ऑप्टिमाइज्ड मॉडलों के लाभों के बावजूद, ऑफ-द-शेल्फ LLMs ने सुरक्षित तैनाती के लिए आवश्यक बुद्धिमत्ता प्राप्त नहीं की है और उन्नत नैदानिक तर्क को प्रदर्शित करने में सीमित हैं।
राव एट अल। (सोम,) ने इस प्रश्न का अध्ययन किया।
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: