Key points are not available for this paper at this time.
Die Erstellung eines realistischen sprechenden Kopfes, der bei Eingabe beliebiger Texte ein realistisch aussehendes Gesicht generiert, das den Text spricht, ist eine seit langem bestehende Forschungsherausforderung. Sprechende Köpfe, die keine Emotionen ausdrücken können, wurden durch den Einsatz von concatenativen Ansätzen Wang et al. 2011 sehr realistisch gestaltet, jedoch stellt die Ermöglichung des Ausdrucks von Emotionen ein weitaus herausfordernderes Problem dar, und modellbasierte Ansätze haben in diesem Bereich vielversprechende Ergebnisse gezeigt. Während 2D sprechende Köpfe derzeit realistischer aussehen als ihre 3D-Pendants, sind sie sowohl in der Bandbreite der Posen, die sie ausdrücken können, als auch in den Lichtverhältnissen, unter denen sie gerendert werden können, eingeschränkt. Frühere Versuche, videorealistische 3D-ausdrucksstarke sprechende Köpfe Cao et al. 2005 zu produzieren, haben ermutigende Ergebnisse erzielt, jedoch noch nicht das Niveau der Realität ihrer 2D-Pendants erreicht.
Anderson et al. (2013) haben diese Frage untersucht.