Key points are not available for this paper at this time.
يعتبر التعرف على تعابير الوجه الديناميكية (DFER) أمرًا بالغ الأهمية لفهم سلوك الإنسان. ومع ذلك، تظهر الطرق الحالية أداءً محدودًا يرجع بشكل رئيسي إلى ندرة البيانات عالية الجودة، وعدم الاستفادة الكافية من ديناميات الوجه، وعدم وضوح دلالات التعبيرات، إلخ. ولهذا الغرض، نقترح إطار عمل جديد، يُسمى FineGRIPER، يتضمن التصاميم الجديدة التالية: 1) لتمييز أفضل بين التعبيرات الوجهية المتشابهة، نوسع تسميات الفئات لتشمل أوصاف نصية من الجوانب الإيجابية والسلبية، ونحصل على إشراف من خلال حساب التشابه عبر الأنماط بناءً على نموذج CLIP؛ 2) يعتمد FineCLIPER الخاص بنا أسلوبًا هرميًا للاستفادة بشكل فعّال من الإشارات المفيدة من مقاطع الفيديو الخاصة بالتعبيرات الديناميكية. على وجه الخصوص، بالإضافة إلى تضمين إطارات الفيديو مباشرة كمدخلات (مستوى دلالي منخفض)، نقترح استخراج أقنعة تقسيم الوجه والمعالم بناءً على كل إطار (مستوى دلالي متوسط) ونستخدم نموذج اللغة الكبير متعدد الأنماط (MLLM) لإنشاء أوصاف تفصيلية للتغيرات في الوجه عبر الإطارات باستخدام المحفزات المصممة (مستوى دلالي عالٍ). بالإضافة إلى ذلك، نعتمد أيضًا على الضبط الدقيق الفعال للمعلمات (PEFT) لتمكين التكيف الفعّال لنماذج كبيرة مُدربة مسبقًا (مثل CLIP) لهذه المهمة. حقق FineCLIPER الخاص بنا أداءً رائدًا في مجموعة بيانات DFEW وFERV39k وMAFW في كل من الإعدادات تحت الإشراف ودون إشراف مع عدد قليل من المعلمات القابلة للتعديل. تؤكد التحليلات والدراسات التجريبية المزيد من فعاليته.
درس تشن وآخرون (يوم الثلاثا،) هذا السؤال.