يُعتبر توليد الرأس المتحدث المدفوع بالنص (THG) تقدماً مهماً في صناعة إنتاج الفيديو من خلال تمكين إنشاء مقاطع فيديو لرؤوس تتحدث بواقعية مع حد أدنى من بيانات الإدخال. بينما استكشف البحث السابق توليف رؤوس تتحدث عبر عمليات قليلة، غالباً ما تكون هذه الطرق غير كافية من حيث اتساق تنسيق الشفاه وتنوع التعبير، وكلاهما ضروري للتطبيقات العملية. في هذه الورقة، نقدم إطار عمل متعدد الوسائط جديد، المتحدث، لتوليف رؤوس تتحدث مع نغمات صوتية وأنماط كلام محددة. أولاً، تم تطوير نموذج تحويل النص إلى كلام (T2S) لتوليد الكلام بنغمة صوتية معينة من النص. ثانياً، صممنا وحدة دمج متعددة الوسائط جديدة لدمج ميزات الكلام والنص بفعالية. ثالثاً، نقترح V-DiT (محول انتشار الفيديو) كعمود فقري لتأطير عملية توليد رؤوس تتحدث كمهام إزالة ضجيج متكررة زمنياً. لتعزيز الأداء بشكل أكبر، تم دمج الظروف الشكلية والزمنية في العمود الفقري كرموز، إلى جانب قطع، لتحسين دقة الصورة وضمان حركة زمنية مكانية سلسة. يتيح هذا التصميم المبتكر لنموذجنا توليد مقاطع فيديو لرؤوس تتحدث عالية الدقة ومتزامنة مع النص، مما يسهل الانتقال بسلاسة عبر هويات متنوعة. تُظهر التجارب الواسعة فعالية نهجنا في إنتاج مقاطع فيديو عالية الجودة لرؤوس تتحدث مدفوعة بالنص.
درس كاي وآخرون (السبت) هذا السؤال.