Key points are not available for this paper at this time.
تُعرف الإجابة على الأسئلة البصرية (VQA) بأنها مهمة متكاملة للذكاء الاصطناعي حيث تتطلب الفهم، والتفكير، واستنتاج المحتوى البصري واللغوي. على مدى السنوات القليلة الماضية، تم اقتراح العديد من الهياكل العصبية لمشكلة VQA. ومع ذلك، لا يزال تحقيق النجاح في VQA صفرية الرماية تحدياً نظراً لمتطلبات المهارات المتقدمة في التعميم والتفكير. تستكشف هذه الدراسة تأثير دمج تسميات الصور كعملية وسيطة ضمن خط أنابيب VQA. على وجه التحديد، نستكشف فعالية استخدام تسميات الصور بدلاً من الصور واستغلال النماذج اللغوية الكبيرة (LLMs) لإنشاء إعداد صفر-shot. بما أن تسميات الصور هي الخطوة الأهم في هذه العملية، نقارن تأثير نماذج تسميات الصور المتطورة على أداء VQA عبر أنواع الأسئلة المختلفة من حيث الهيكل والدلالة. نقترح نهجاً بسيطاً وفعالاً لتسميات الصور المدفوعة بالسؤال ضمن هذا الخط الأنبوبي لنقل المعلومات السياقية إلى نموذج الإجابة على الأسئلة (QA). تتضمن هذه الطريقة استخراج الكلمات الرئيسية من السؤال، وإنشاء تسمية لكل زوج صورة-سؤال باستخدام الكلمات الرئيسية، ودمج التسمية المدفوعة بالسؤال في محفز LLM. نقوم بتقييم فعالية استخدام تسميات الصور الشاملة والمدفوعة بالسؤال في خط أنابيب VQA. تسلط دراستنا الضوء على إمكانيات استخدام تسميات الصور واستغلال قدرات LLMs لتحقيق أداء تنافسي في GQA تحت إعداد صفر-shot. شفراتنا متاحة على https://github.com/ovguyo/captions-in-VQA.
درس أوزديمير وآخرون (2024) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: