Key points are not available for this paper at this time.
يتمتع توليد الوجوه المتحدثة الحية بإمكانات تطبيقية هائلة عبر مجالات الوسائط المتعددة المتنوعة، مثل إنتاج الأفلام والألعاب. في حين أن الطرق الحالية تتزامن بدقة بين حركات الشفاه والصوت المدخل، فإنها عادةً ما تتجاهل المحاذاة الحاسمة بين العواطف والإشارات الوجهية، والتي تشمل التعبيرات، النظرات، ووضع الرأس. هذه المحاذاة ضرورية لتوليد فيديوهات واقعية. للتعامل مع هذه القضايا، نقترح إطار عمل لتوليد الوجوه المتحدثة مدفوع بالصوت يتكون من مرحلتين يستخدم علامات الوجه ثلاثية الأبعاد كمتغيرات وسيطة. يحقق هذا الإطار المحاذاة التعاونية للتعبير والنظرات والوضع مع العواطف من خلال التعلم الذاتي. بالتحديد، نقوم بتجزئة هذه المهمة إلى خطوتين رئيسيتين، وهما توليد العلامات من الكلام وتوليد الوجه من العلامات. تركز الخطوة الأولى على توليد إشارات وجهية متوافقة عاطفيًا في وقت واحد، بما في ذلك العلامات الموحدة التي تمثل التعبيرات والنظرات ووضع الرأس. يتم إعادة تجميع هذه الإشارات بعد ذلك إلى علامات وجهية معاد توجيهها. في الخطوة الثانية، يتم رسم هذه العلامات المعاد توجيهها إلى نقاط رئيسية كامنة باستخدام التعلم الذاتي، ثم يتم إدخالها في نموذج مدرب مسبقًا لإنشاء صور وجه عالية الجودة. تظهر التجارب الواسعة على مجموعة بيانات MEAD أن نموذجنا يحقق تقدمًا كبيرًا في الأداء مقارنةً بأحدث التقنيات في كل من الجودة البصرية والمحاذاة العاطفية.
درس ليانغ وآخرون (الأربعاء) هذا السؤال.