Key points are not available for this paper at this time.
إن ظهور نماذج تدريب اللغة والصورة المتناقضة (CLIP) قد أحدث ثورة في دمج التمثيلات النصية والبصرية، مما يعزز بشكل كبير تفسير الصور الثابتة. ومع ذلك، فإن تطبيقها على تعرف الفيديو يواجه تحديات فريدة بسبب الديناميكية الطبيعية والطبيعة متعددة الوسائط لمحتوى الفيديو، مما يشمل التغيرات الزمنية والتفاصيل المكانية التي تتجاوز قدرات نماذج CLIP التقليدية. تتطلب هذه التحديات نهجًا متقدمًا قادرًا على فهم التفاعل المعقد بين الأبعاد المكانية والزمنية لبيانات الفيديو. ولهذا الغرض، تقدم هذه الدراسة نهجًا مبتكرًا، وهو ضبط المحول القابل للاحتفاظ (RCAT)، الذي يجمع بين القوى الأساسية لـ CLIP مع قدرة المعالجة الديناميكية لشبكة الاحتفاظ (RetNet). تم تصميمه خصيصًا لتحسين قابلية تطبيق CLIP على تعرف الفيديو، ويسهل RCAT فهمًا دقيقًا لتسلسلات الفيديو من خلال الاستفادة من التحليل الزمني. في جوهر RCAT هو آلية ضبط المحول المتخصصة، التي تعدل نموذج CLIP ليتماشى بشكل أفضل مع التعقيدات الزمنية والتفاصيل المكانية لمحتوى الفيديو، مما يعزز دقة التنبؤ وعمق التفسير للنموذج. تؤكد تقييماتنا الشاملة على مجموعات البيانات القياسية، بما في ذلك UCF101 و HMDB51 و MSR-VTT، فعالية RCAT. يحقق نهجنا المقترح تحسنًا ملحوظًا في الدقة بنسبة 1.4% على UCF101، و2.6% على HMDB51، و1.1% على MSR-VTT مقارنة بالنماذج الحالية، مما يوضح أدائه المتفوق وقابليته للتكيف في سياق مهام تعرف الفيديو.
قام شياي وآخرون (السبت) بدراسة هذا السؤال.