Key points are not available for this paper at this time.
يهدف تضمين المرئيات والدلالات إلى إيجاد مساحة كامنة مشتركة حيث تكون العينات المرئية والنصية ذات الصلة قريبة من بعضها. تتعلم معظم الطرق الحالية دوال تضمين حقنية تMapping كائنًا إلى نقطة واحدة فقط في الفضاء المشترك. للأسف، لا يمكن أن تتعامل التضمينات الحقنية بشكل فعال مع العينات متعددة المعاني التي لديها معاني ممكنة متعددة؛ على أحسن تقدير، ستحصل على تمثيل متوسط لمختلف المعاني. هذا يعيق استخدامها في السيناريوهات الحقيقية حيث تكون العينات الفردية وارتباطاتها عبر الأنماط غالبًا غامضة. في هذا العمل، نقدم شبكات تضمين العينات متعددة المعاني (PIE-Nets) التي تحسب تمثيلات متعددة ومتنوعة لكائن عن طريق دمج السياق العالمي مع الميزات الموجهة محليًا عبر الانتباه الذاتي متعدد الرؤوس والتعلم المتبقي. لتعلم تضمين المرئيات والدلالات، نقوم بربط اثنين من PIE-Nets ونجري تحسينًا مشتركًا لهما في إطار التعلم المتعدد العينات. تركز معظم الأعمال الحالية على استرجاع البيانات من أزواج الصور والنصوص. هنا، نتناول أيضًا حالة أكثر تحدياً لاسترجاع الفيديو والنص. لتسهيل مزيد من البحث في استرجاع الفيديو والنص، نطلق مجموعة بيانات جديدة تحتوي على 50 ألف زوج من الفيديو والنص تم جمعها من وسائل التواصل الاجتماعي، تسمى MRW (رد فعلي عندما). نعرض مقاربتنا في كل من سيناريوهات استرجاع الصورة والنص والفيديو والنص باستخدام مجموعة بيانات MS-COCO وTGIF وMRW الجديدة.
درس سونغ وزملاؤه (سات،) هذا السؤال.
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: