Key points are not available for this paper at this time.
पृष्ठभूमि बड़े भाषा मॉडल (एलएलएम) ने शैक्षणिक समुदाय में रुचि और चिंता दोनों को प्रभावित किया है। ये व्यवस्थित समीक्षाओं के लिए साहित्य खोज और संश्लेषण को स्वचालित करने की संभावना प्रस्तुत करते हैं लेकिन उनकी विश्वसनीयता के संबंध में चिंताएँ उठाते हैं, क्योंकि असहाय (हैलुसिनेटेड) सामग्री उत्पन्न करने की प्रवृत्ति बनी रहती है। उद्देश्य अध्ययन का लक्ष्य वैज्ञानिक लेखन के संदर्भ में चैटजीपीटी और बार्ड (बाद में पुनः ब्रांडेड जेमिनी) जैसे एलएलएम के संदर्भ उत्पादन के प्रदर्शन का आकलन करना है। विधियाँ मानव-नियोजित व्यवस्थित समीक्षाओं के परिणामों को दोहराने में चैटजीपीटी और बार्ड के प्रदर्शन का मूल्यांकन किया गया। कंधे के रोटेटर कफ पैथोलॉजी से संबंधित व्यवस्थित समीक्षाओं का उपयोग करते हुए, इन एलएलएम का परीक्षण समान समावेशन मानदंड प्रदान करके किया गया और मूल व्यवस्थित समीक्षा संदर्भों के साथ परिणामों की तुलना की गई, जो कि स्वर्ण मानक के रूप में कार्य कर रहे थे। अध्ययन ने 3 प्रमुख प्रदर्शन मैट्रिक्स का उपयोग किया: पुनः कॉल, सटीकता, और एफ1-स्कोर, साथ ही साथ हैलुसिनेशन दर। यदि निम्नलिखित सूचना में से कोई 2 गलत थे, तो पत्रों को
Chelli et al. (Wed,) studied this question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: