Key points are not available for this paper at this time.
في سياق العصر الرقمي، أصبح التعليم عن بُعد جزءًا لا يتجزأ من نظام التعليم العالمي. يعتمد التعليم عن بُعد الفعال على التفاعلية العالية لمنصات التفاعل والتوصيل الدقيق لمحتوى التعليم، حيث تلعب تكنولوجيا التعرف على الصور متعددة الوسائط دورًا رئيسيًا. تعزز هذه التكنولوجيا مستوى الذكاء في منصات التعليم عن بُعد من خلال دمج المعلومات المرئية والنصية، مما يوفر تجربة تفاعلية أغنى وأكثر حدسية للمعلمين والطلاب. ومع ذلك، لا تزال تقنيات التعرف على الصور متعددة الوسائط الحالية تواجه تحديات في الدقة والأداء في الوقت الحقيقي والفهم الدلالي، خاصة في السيناريوهات التعليمية المعقدة حيث لا يكون الفهم والتغذية الراجعة حول محتوى التعليم دقيقين بما فيه الكفاية، مما يحد من فعالية منصات تفاعل التعليم عن بُعد. للتصدي لهذه القيود، تقترح هذه الورقة طريقة محاذاة الصور متعددة الوسائط استنادًا إلى آلية الانتباه الذاتي التي تقوم بدمج المعلومات المرئية بشكل فعال في نموذج تشفير-فك تشفير لتحقيق اتساق عالٍ بين الصور ومحتوى التعليم. بالإضافة إلى ذلك، يتم تقديم خوارزمية جديدة لتوضيح وتعرف الصور متعددة الوسائط، تأخذ في الاعتبار كلاً من المعلومات الدلالية والبارزة المرئية لتحقيق دقة أعلى في التعرف والعملية. تظهر التحقق التجريبي تحسينات كبيرة في دقة وأداء التعرف على الصور متعددة الوسائط، مقدمة دعمًا تقنيًا قويًا لمنصات التعليم عن بُعد، وتحسين توزيع الموارد التعليمية، وتعزيز جودة وكفاءة التعليم.
درس كوين وآخرون (الخميس) هذا السؤال.