In den letzten Jahren hat die sprechergesteuerte Gesichtssynthese aufgrund ihrer Vielzahl an Anwendungen in virtuellen Menschen, Remote-Konferenzen und digitaler Menschenerzeugung erhebliches Interesse geweckt. Bestehende Methoden stoßen jedoch weiterhin auf Einschränkungen hinsichtlich Realismus, Synchronisation und Robustheit, insbesondere aufgrund von Störungen in Sprachsignalen und unzureichender Präzision bei der Audio-Visuellen Merkmalsfusion. Um diese Herausforderungen anzugehen, schlägt dieses Papier ein verbessertes Framework für die sprechergesteuerte Gesichtssynthese vor: RAE-NeRF (Residual-basierter Audio-Video-Encoder mit Neural Radiance Fields). Das Framework integriert drei Kernmodule: (1) das ZipEnhancer-Sprachverbesserungsmodul, das hochwertige Merkmale aus rauschhaften Sprachsignalen extrahiert; (2) einen residual-basierten Audio-Visuellen Encoder, der Audio- und visuelle Merkmale effektiv fusioniert, um Gesichtsausdrücke genau zu steuern; und (3) einen Tri-Plane-Hash-Encoder, der hochqualitatives 3D-Gesichtmodellieren und Rendering erreicht und gleichzeitig die Effizienz aufrechterhält. Umfangreiche Experimente, die an mehreren Datensätzen durchgeführt wurden, zeigen, dass RAE-NeRF bestehende gängige Ansätze hinsichtlich Realismus, Lippen-Synchronisationsgenauigkeit und Rauschrobustheit erheblich übertrifft, was die Wirksamkeit und Überlegenheit des vorgeschlagenen Frameworks in komplexen Umgebungen für die sprechergesteuerte Gesichtssynthese validiert.
PANG et al. (Fr,) haben diese Frage untersucht.