Key points are not available for this paper at this time.
كجزء أساسي من توليد الوجه المتكلم، فإن توليد حركات الشفاه يحدد طبيعة وتناسق فيديو الوجه المتكلم الذي يتم انتاجه. تركز الأدبيات السابقة بشكل رئيسي على توليد الكلام إلى الشفاه بينما هناك نقص في توليد النص إلى الشفاه (T2L). يعد T2L مهمة صعبة، وتعتمد الأعمال القائمة على هذا النوع على آلية الانتباه وطريقة فك التشفير التلقائي (AR). ومع ذلك، فإن طريقة فك التشفير AR تولد إطار الشفاه الحالي مهيأً على الإطارات التي تم توليدها مسبقاً، مما يعيق سرعة الاستدلال بشكل جوهري، وله تأثير ضار أيضاً على جودة إطارات الشفاه التي تم توليدها بسبب انتقال الخطأ. وهذا يشجع على البحث في توليد T2L المتوازي. في هذا العمل، نقترح نموذج فك تشفير متوازي لتوليد النص إلى الشفاه بسرعة ودقة عالية (ParaLip). على وجه التحديد، نتنبأ بمدة الميزات اللغوية المشفرة ونشكل إطارات الشفاه المستهدفة مهيأةً على الميزات اللغوية المشفرة مع مدتها بطريقة غير تلقائية. علاوة على ذلك، ندمج فقدان مؤشر التشابه الهيكلي وتعلم الخصوم لتحسين الجودة الإدراكية لإطارات الشفاه المولدة والتخفيف من مشكلة التنبؤ الضبابي. تجارب واسعة أجريت على مجموعات بيانات GRID وTCD-TIMIT تظهر تفوق الأساليب المقترحة.
درس ليو وآخرون (الثلاثاء) هذا السؤال.
Synapse has enriched one closely related paper. Consider it for comparative context: