Key points are not available for this paper at this time.
تستكشف هذه الدراسة طريقة نفسية إحصائية لتحليل البيانات النصية باستخدام التضمينات السياقية الناتجة عن النماذج اللغوية الكبيرة. تستفيد الطريقة المقترحة من التضمينات السياقية لإنشاء درجات سياقية، والتي تُستخدم بعد ذلك كمدخل لإنشاء نماذج تحليل العوامل. من خلال اعتبار الوثائق كأفراد والكلمات كعناصر، توفر هذه الطريقة تفسيرًا نفسيًا إحصائيًا طبيعيًا، مما يكشف عن مشهد شاسع وغير مستكشَف للبحوث المستقبلية. تفترض أن بعض الكلمات، التي تتفاوت معانيها السياقية بشكل كبير عبر الوثائق، يمكن استخدامها لتمييز الوثائق ضمن مجموعة نصية. تتكون عملية النمذجة من مرحلتين: الحصول على الدرجات السياقية وإجراء تحليل العوامل. تتضمن المرحلة الأولى استخدام تقنيات معالجة اللغة الطبيعية ونماذج المحولات المبنية على المتجهات للعثور على الكلمات الرئيسية الشائعة وتوليد الدرجات السياقية. تتضمن المرحلة الثانية استخدام أنواع مختلفة من تحليل العوامل لاستخراج وتحديد العوامل، والحصول على ارتباطات العوامل، وتحديد الكلمات الرئيسية للعوامل. تم اختبارها على مجموعة Wiki STEM، وتظهر النتائج التجريبية فرص وتحديات الطريقة الجديدة في تحليل البيانات النصية من خلال دمج كل من النماذج اللغوية الكبيرة والنمذجة النفسية الإحصائية.
درس جينسوتغ تشين (يوم الجمعة) هذا السؤال.