हम PersonaConvBench प्रस्तुत करते हैं, जो बड़ी भाषा मॉडल (LLMs) के साथ बहु-टर्न संवादों में व्यक्तिगत तर्क और उत्पादन का मूल्यांकन करने के लिए एक बड़े पैमाने पर बेंचमार्क है। मौजूदा कार्य जो या तो व्यक्तिगतता या संवादात्मक संरचना को पृथक रूप से केंद्रित करते हैं, के विपरीत, PersonaConvBench दोनों को एकीकृत करता है, और तीन मुख्य कार्य प्रदान करता है: वाक्य वर्गीकरण, प्रभाव प्रतिगमन, और दस विविध Reddit-आधारित डोमेन में उपयोगकर्ता-केंद्रित पाठ उत्पादन। यह डिज़ाइन यह सक्षम बनाता है कि कैसे व्यक्तिगत संवादात्मक संदर्भ वास्तविक बहु-उपयोगकर्ता परिस्थितियों में LLM आउटपुट को आकार देता है, इस पर व्यवस्थित विश्लेषण किया जा सके। हम कई व्यावसायिक और ओपन-सोर्स LLMs का एकीकृत प्रॉम्प्टिंग सेटअप के अंतर्गत बेंचमार्क करते हैं और देखते हैं कि व्यक्तिगत इतिहास को शामिल करने से प्रदर्शन में भारी सुधार होता है, जिसमें सेंटिमेंट वर्गीकरण में सबसे अच्छे गैर-संवादात्मक आधार रेखा की तुलना में 198 प्रतिशत सापेक्ष वृद्धि शामिल है। PersonaConvBench को मूल्यांकन और कोड के साथ जारी करके, हमारा लक्ष्य उन LLMs पर शोध का समर्थन करना है जो व्यक्तिगत शैलियों के अनुसार अनुकूलित होते हैं, दीर्घकालिक संदर्भ को ट्रैक करते हैं, और संदर्भगत रूप से समृद्ध, आकर्षक उत्तर उत्पन्न करते हैं।
ली एट अल। (मंगलवार,) ने इस प्रश्न का अध्ययन किया।
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: