Key points are not available for this paper at this time.
تعتبر مهمة استرجاع الصورة والنص مهمة صعبة. تهدف إلى قياس التوافق المرئي الدلالي بين صورة وعنوان نصي. هذا صعب بشكل رئيسي لأن الصورة تفتقر إلى معلومات السياق الدلالي كما في عنوانها النصي المقابل، وتمثيل النص محدود جدًا لوصف تفاصيل الصورة بالكامل. في هذه الورقة، نقدم تمثيلات مزدوجة تعتمد على الرسم البياني (GraDual)، بما في ذلك تضمين النص المدمج مع الرؤية (VITE) وتضمين الصورة المدمج مع السياق (CIVE) لاسترجاع الصورة والنص. يحسن GraDual من تغطية كل وضعية من خلال استغلال دلالات السياق النصي لتمثيل الصورة، واستخدام الميزات المرئية كإرشادات لتمثيل النص. تحديدًا، نصمم: 1) آلية تمثيل الرسم البياني المزدوج لحل مشكلة نقص التغطية لكل وضعية. 2) استراتيجية دمج تضمين الرسم البياني الوسيطة لتعزيز النمط المهم عبر ميزات الوضعية الأخرى العالمية. 3) شبكة مطابقة عبر الوضعيات مدفوعة بالنمط المزدوج لتوليد تمثيل مصفّى لوضعية أخرى. تظهر التجارب الموسعة على مجموعتين مرجعيتين، MS-COCO وFlickr30K، تفوق GraDual المقترح مقارنة بالطرق المتطورة.
درس لونغ وآخرون (سات) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: