Key points are not available for this paper at this time.
يُعتبر التدريب المسبق على الفيديو-لغة ذات المركز الذاتي نموذجاً أساسياً لتقدم تعلم تفاعلات اليد-الشيء ذات المركز الذاتي (EgoHOI). على الرغم من النجاح الكبير في حلبات الاختبار الحالية، تركز هذه المعايير أكثر على المفاهيم البصرية المغلقة أو السيناريوهات المحدودة. نظراً لوجود تفاعلات EgoHOI متنوعة في العالم الحقيقي، نقترح معياراً مفتوحاً للمفردات باسم EgoHOIBench لكشف الأداء المنخفض لنماذج الفيديو-لغة ذات المركز الذاتي الحالية (EgoVLM) على المفاهيم الدقيقة، مما يدل على أن هذه النماذج لا تزال تفتقر إلى طيف كامل من الفهم الذاتي. نُنسب هذه الفجوة في الأداء إلى الإشراف المحدود الدقيق والتحيز القوي نحو فهم الأشياء بدلاً من الديناميات الزمنية في الأساليب الحالية. لمعالجة هذه القضايا، نقدم هدفًا غير متماثل جديد يسمى EgoNCE++ لتفاعلات EgoHOI. بالنسبة لخسارة الفيديو إلى النص، نحن نُعزز الإشراف النصي من خلال توليد تسميات سلبية عن طريق الاستفادة من التعلم في السياق لنماذج اللغة الكبيرة لأداء استبدال الكلمات المتعلقة بـ HOI. بالنسبة لخسارة النص إلى الفيديو، نقترح استراتيجية أخذ عينات فيديو إيجابية محورية بالاستناد إلى الأشياء تجمع التمثيلات الفيديوية من نفس الأسماء. تظهر تجاربنا الواسعة أن EgoNCE++ تعزز بشكل كبير التعرف على تفاعلات HOI بمفردات مفتوحة، واسترجاع متعدد العينات، ومهام التعرف على الأنشطة عبر نماذج ذات مركز ذاتي متنوعة، مع تحسينات تصل إلى +26.55%. لدينا الشيفرة متاحة على https://github.com/xuboshen/EgoNCEpp.
درس Xu وآخرون (Mon,) هذا السؤال.