Key points are not available for this paper at this time.
ندرس التنوع الثقافي والاجتماعي الاقتصادي في نماذج الرؤية واللغة التباينية (VLMs). باستخدام مجموعة واسعة من مجموعات البيانات القياسية ومقاييس التقييم، نسلط الضوء على عدة نتائج مهمة. أولاً، التصفية الشائعة لبيانات التدريب لتشمل أزواج الصور والنصوص باللغة الإنجليزية تضع المجتمعات ذات المستوى الاجتماعي الاقتصادي المنخفض في وضع غير مواتى وتؤثر سلباً على الفهم الثقافي. ومن الجدير بالذكر أن هذه الفجوة في الأداء لا تُلتقط بواسطة - وحتى تتعارض مع - مقاييس التقييم الشائعة المستمدة من مجموعات البيانات الغربية-centric مثل ImageNet و COCO. ثانياً، يمكن أن يؤدي التهيئة المسبقة باستخدام بيانات عالمية غير مصفّاة قبل الضبط الدقيق على المحتوى الإنجليزي إلى تحسين الفهم الثقافي دون التضحية بالأداء على هذه المقاييس الشائعة. ثالثاً، نقدم مهمة التموقع الجغرافي كمقياس تقييم جديد لتقييم التنوع الثقافي في نماذج VLMs. تؤكد دراستنا على قيمة استخدام بيانات متنوعة لإنشاء أنظمة متعددة الوسائط أكثر شمولاً وتضع الأساس لتطوير نماذج VLMs تمثل وجهات نظر عالمية بشكل أفضل.
درس بوجيت وآخرون (الأربعاء) هذا السؤال.