Key points are not available for this paper at this time.
Die lebendige Erzeugung von sprechenden Gesichtern hat potenzielle Anwendungen in der virtuellen Realität. Bestehende Methoden können sprechende Gesichter generieren, die mit dem Audio synchronisiert sind, ignorieren jedoch typischerweise den exakten Ausdruck von Emotionen. In diesem Papier schlagen wir einen fortschrittlichen zweistufigen Rahmen vor, um Videos von sprechenden Gesichtern mit lebendigen emotionalen Erscheinungen zu synthetisieren. Der erste Schritt ist darauf ausgelegt, emotionale fein-grained Landmarken zu erzeugen, einschließlich der normalisierten Landmarken, des Blicks und der Kopfhaltung. Im zweiten Schritt ordnen wir die Gesichtslandmarken latenten Schlüsselstellen zu, die dann in das vortrainierte Modell eingespeist werden, um qualitativ hochwertige Gesichtsbilder zu generieren. Umfassende Experimente zeigen die Wirksamkeit unserer Methode.
Liang et al. (Sat,) haben diese Frage untersucht.