Key points are not available for this paper at this time.
نقدم لكم ObamaNet، المعمارية الأولى التي تولد كل من الصوت ومقاطع الفيديو المتزامنة مع مزامنة الشفاه الواقعية من أي نص جديد. على عكس الأساليب الأخرى المنشورة لمزامنة الشفاه، تتكون معماريتنا فقط من وحدات عصبية قابلة للتدريب بالكامل ولا تعتمد على أي طرق تقليدية للرسم الحاسوبي. بشكل أكثر دقة، نستخدم ثلاث وحدات رئيسية: شبكة تحويل النص إلى كلام مبنية على Char2Wav، و LSTM ذات تأخير زمني لتوليد نقاط مفتاحية للفم متزامنة مع الصوت، وشبكة مبنية على Pix2Pix لتوليد إطارات الفيديو المشروطة على النقاط المفتاحية.
درس كومار وآخرون (الأربعاء) هذا السؤال.