Key points are not available for this paper at this time.
ظهرت تقارب كبير بين اللغة والرؤية والتدريب المسبق متعدد الوسائط. في هذا العمل، نقدم نموذجًا أساسيًا متعدد الوسائط عام BEiT-3، الذي يحقق أداءً متفوقًا في نقل المعرفة على كل من مهام الرؤية والرؤية-لغة. بشكل محدد، نُقدم التقارب الكبير من ثلاثة جوانب: بنية العمود الفقري، مهمة التدريب المسبق، وتوسيع النموذج. نقدم محولات متعددة الاتجاهات للنمذجة العامة، حيث تتيح البنية المعدلة الاندماج العميق والترميز المحدد لكل وسيلة. بناءً على العمود الفقري المشترك، نقوم بأداء نمذجة "اللغة" المقنعة على الصور (Imglish)، والنصوص (الإنجليزية)، وأزواج الصورة-النص ("الجمل المتوازية") بطريقة موحدة. تظهر النتائج التجريبية أن BEiT-3 يحقق أداءً متفوقًا على كشف الأجسام (COCO)، والتقسيم الدلالي (ADE20K)، وتصنيف الصور (ImageNet)، والتفكير البصري (NLVR2)، والإجابة على الأسئلة البصرية (VQAv2)، وتوضيح الصور (COCO)، والاسترجاع عبر الوسائط (Flickr30K، COCO).
درس وانغ وآخرون (Mon ،) هذا السؤال.