Key points are not available for this paper at this time.
Wir schlagen einen neuen 3D fotorealistischen sprechenden Kopf mit hochwertiger Lippen-synchronisierter Animation vor. Er erweitert unseren vorherigen hochwertigen 2D fotorealistischen sprechenden Kopf auf 3D. Zunächst wird eine a/v Aufnahme einer Person gemacht, die einen Satz von vorgegebenen Sätzen mit guter phonemischer Abdeckung für ca. 20 Minuten spricht. Danach verwenden wir einen 2D-zu-3D Rekonstruktionsalgorithmus, um ein allgemeines 3D-Kopf-Mesh-Modell automatisch an die Person anzupassen. Im Training werden Super-Feature-Vektoren, die aus 3D-Geometrie, Textur und Sprache bestehen, zusammen augmentiert, um ein statistisches, multiströmiges Hidden Markov Modell (HMM) zu trainieren. Das HMM wird dann verwendet, um sowohl die Trajektorien der Kopfbewegungsanimation als auch die entsprechenden dynamischen Texturen zu synthetisieren. Die resultierende 3D sprechende Kopfanimation kann durch die vom Modell vorhergesagte geometrische Trajektorie gesteuert werden, während die Artikulatorbewegungen, z.B. die Lippen, mit dynamischen 2D-Texturbildsequenzen gerendert werden. Kopfbewegungen und Gesichtsausdrücke können auch separat gesteuert werden, indem die entsprechenden Parameter manipuliert werden. In einer Echtzeitdemonstration kann der lebensechte 3D sprechende Kopf beliebigen Eingabetext annehmen, ihn in Sprache umwandeln und die Lippen-synchronisierte Sprachanimation fotorealistisch rendern.
Wang et al. (Thu,) haben diese Frage untersucht.