Key points are not available for this paper at this time.
Wir präsentieren MAV3D (Make-A-Video3D), eine Methode zur Generierung dreidimensionaler dynamischer Szenen aus Textbeschreibungen. Unser Ansatz verwendet ein 4D dynamisches Neural Radiance Field (NeRF), das für das Erscheinungsbild der Szene, die Dichte und die Bewegungs-Konsistenz optimiert ist, indem es ein Text-zu-Video (T2V) diffusionsbasiertes Modell abfragt. Der aus dem bereitgestellten Text erzeugte dynamische Videoausgang kann von jedem Kameraort und -winkel aus betrachtet werden und kann in jede 3D-Umgebung integriert werden. MAV3D benötigt keine 3D- oder 4D-Daten und das T2V-Modell wird nur mit Text-Bild-Paaren und unmarked Videos trainiert. Wir demonstrieren die Effektivität unseres Ansatzes mit umfassenden quantitativen und qualitativen Experimenten und zeigen eine Verbesserung gegenüber bereits etablierten internen Baselines. Soweit wir wissen, ist unsere Methode die erste, die 3D dynamische Szenen anhand einer Textbeschreibung generiert.
Singer et al. (Do,) haben diese Frage untersucht.