نقترح MORAL (إطار عمل متعدد الأنماط لتعلم التعزيز في اتخاذ القرار في المختبرات المستقلة) الذي يعزز اتخاذ القرار المتتابع في المختبرات الروبوتية المستقلة من خلال دمج المدخلات البصرية والنصية. باستخدام مجموعة بيانات BridgeData V2، نقوم بإنشاء تسميات دقيقة للصور باستخدام نموذج لغة الرؤية المدرب مسبقًا BLIP-2 ونجمعها مع الميزات البصرية من خلال استراتيجية دمج مبكر. يتم معالجة التمثيلات المدمجة باستخدام وكلاء شبكة Q العميقة (DQN) وتحسين السياسة القريب (PPO). تظهر النتائج التجريبية أن الوكلاء متعددوا الأنماط يحققون تحسينًا بنسبة 20% في معدلات إكمال المهام ويتفوقون بشكل كبير على المعايير القائمة على المرئيات فقط والنصوص فقط بعد تدريب كافٍ. مقارنة بالنماذج متعددة الأنماط القائمة على المحولات والنماذج المتكررة، تحقق طريقتنا أداءً متفوقًا في مقاييس المكافآت التراكمية وجودة التسميات (BLEU، METEOR، ROUGE-L). تسلط هذه النتائج الضوء على تأثير مؤشرات اللغة المتوافقة دلاليًا في تعزيز كفاءة تعلم الوكلاء والتعميم. يسهم الإطار المقترح في تقدم تعلم التعزيز متعدد الأنماط وأنظمة الذكاء الاصطناعي المجسدة في بيئات ديناميكية وعالمية.
درس تيراباسي وزملاؤه (الجمعة) هذا السؤال.