Key points are not available for this paper at this time.
وصف محتوى الفيديو تلقائيًا بلغة طبيعية هو تحدٍ أساسي في رؤية الكمبيوتر. لقد جذبت الشبكات العصبية التكرارية (RNNs)، التي نمذجة ديناميات التسلسل، اهتمامًا متزايدًا في التفسير البصري. ومع ذلك، تولد معظم الأساليب الحالية كلمة محليًا مع الكلمات السابقة المعطاة والمحتوى البصري، بينما لا يتم استغلال العلاقة بين دلالات الجمل والمحتوى البصري بشكل شامل. ونتيجة لذلك، قد تكون الجمل الناتجة صحيحة سياقيًا ولكن الدلالات (مثل، المواضيع، الأفعال أو الأغراض) ليست صحيحة. يقدم هذا البحث إطار عمل موحد جديد، يسمى الذاكرة طويلة وقصيرة المدى مع التضمين البصري الدلالي (LSTM-E)، والذي يمكنه استكشاف تعلم LSTM والتضمين البصري الدلالي في آن واحد. الهدف من الأول هو تعظيم احتمالية توليد الكلمة التالية بالنظر إلى الكلمات السابقة والمحتوى البصري، بينما الهدف من الثاني هو إنشاء مساحة تضمين بصري دلالي لتأكيد العلاقة بين دلالة الجملة الكاملة والمحتوى البصري. تُظهر التجارب على مجموعة بيانات YouTube2Text أن LSTM-E المقترح لدينا يحقق حتى الآن أفضل أداء منشور في توليد جمل طبيعية: 45.3% و31.0% من حيث BLEU@4 وMETEOR، على التوالي. كما تم الإبلاغ عن أداء متفوق في مجموعة بيانات وصفيات الأفلام (M-VAD وMPII-MD). بالإضافة إلى ذلك، نظهر أن LSTM-E يتفوق على العديد من التقنيات الحديثة في التنبؤ بثلاثيات الفاعل والفعل والمفعول به (SVO).
درس بان وآخرون (الأربعاء) هذا السؤال.
Synapse has enriched one closely related paper. Consider it for comparative context: