نقدم نظامًا لتحريك الوجوه ثلاثية الأبعاد الواقعية في الوقت الحقيقي يعتمد على الصوت مع الحد الأدنى من وقت التأخير، مصمم للتفاعلات الاجتماعية في الواقع الافتراضي للجميع. في صميم نهجنا، نموذج ضغط يحول الإشارات الصوتية إلى تسلسل تعبيرات وجه كامنة في الوقت الحقيقي، والتي يتم فك شفرتها بعد ذلك كوجوه ثلاثية الأبعاد واقعية. من خلال الاستفادة من قدرات النماذج التوليدية، نقوم بالتقاط الطيف الغني من تعبيرات الوجه اللازمة للتواصل الطبيعي، مع تحقيق أداء في الوقت الحقيقي (<15ms وقت GPU). تقلل معمارينا الجديدة من وقت التأخير من خلال ابتكارين رئيسيين: محول على الإنترنت يلغي الاعتماد على المدخلات المستقبلية وخط أنابيب للتقطير يسرع إزالة الضوضاء التكرارية إلى خطوة واحدة. نحن نتناول أيضًا تحديات التصميم الحرجة في السيناريوهات الحية لمعالجة إشارات الصوت المستمرة إطارًا بإطار مع الحفاظ على جودة التحريك المستمرة. تمتد مرونة إطارنا إلى تطبيقات متعددة النماذج، بما في ذلك الأنواع الدلالية مثل حالات العاطفة وأجهزة الاستشعار متعددة النماذج مع كاميرات عيون مثبتة على الرأس في نظارات الواقع الافتراضي. تظهر النتائج التجريبية تحسينات كبيرة في دقة تحريك الوجه مقارنةً بالأسس الحالية الحديثة. نحن نتحقق من نهجنا من خلال عروض الواقع الافتراضي الحية وفي مختلف السيناريوهات مثل الخطابات متعددة اللغات.
درس لي وآخرون (الأربعاء) هذا السؤال.