Key points are not available for this paper at this time.
أقدم هنا تحليلًا شاملاً حول التفضيلات السياسية المضمنة في نماذج اللغة الكبيرة (LLMs). وهي، أنني أجري 11 اختبارًا للتوجه السياسي، مصممًا لتحديد التفضيلات السياسية لمن يتولى الاختبار، على 24 نموذجًا حديثًا للحوار LLMs، سواء كانت مغلقة أو مفتوحة المصدر. عند استجوابها بأسئلة/تصريحات ذات دلالات سياسية، تميل معظم نماذج LLMs الحوارية إلى إنتاج ردود تعكسها معظم أدوات الاختبار السياسي كإظهار تفضيلات لوجهات نظر يسارية. ومع ذلك، لا يبدو أن هذا هو الحال بالنسبة لخمس نماذج أساسية إضافية (أي الأساس) التي تم بناء LLMs المخصصة للحوار مع البشر عليها. ومع ذلك، فإن الأداء الضعيف للنماذج الأساسية في الإجابة بشكل متماسك عن أسئلة الاختبارات يجعل هذه المجموعة من النتائج غير حاسمة. أخيرًا، أظهر أن نماذج LLMs يمكن توجيهها نحو مواقع محددة في الطيف السياسي من خلال ضبط دقيق تحت الإشراف (SFT) مع كميات معتدلة فقط من البيانات المتوافقة سياسيًا، مما يوحي بإمكانات SFT في تضمين التوجه السياسي في LLMs. مع بدء LLMs في استبدال المصادر التقليدية للمعلومات مثل محركات البحث وويكيبيديا جزئيًا، فإن التداعيات الاجتماعية للتحيزات السياسية المضمنة في LLMs كبيرة.
ديفيد روزادو (الأربعاء) درس هذا السؤال.