Los puntos clave no están disponibles para este artículo en este momento.
La síntesis de objetos 3D de dominio abierto ha estado rezagada respecto a la síntesis de imágenes debido a datos limitados y mayor complejidad computacional. Para cerrar esta brecha, trabajos recientes han investigado la difusión multivista, pero a menudo no alcanzan la consistencia 3D, la calidad visual o la eficiencia. Este documento propone MVEdit, que funciona como un contraparte 3D de SDEdit, empleando muestreo ancestral para desruido conjunto de imágenes multivista y salida de mallas texturizadas de alta calidad. Basado en modelos de difusión 2D disponibles en el mercado, MVEdit logra consistencia 3D a través de un Adaptador 3D sin entrenamiento, que eleva las vistas 2D del último paso temporal a una representación 3D coherente, luego condiciona las vistas 2D del siguiente paso temporal usando vistas renderizadas, sin comprometer la calidad visual. Con un tiempo de inferencia de solo 2-5 minutos, este marco logra un mejor equilibrio entre calidad y velocidad que la destilación de puntajes. MVEdit es altamente versátil y extensible, con un amplio rango de aplicaciones que incluyen generación de texto/imágenes a 3D, edición 3D a 3D y síntesis de texturas de alta calidad. En particular, las evaluaciones demuestran un rendimiento de vanguardia en tareas de generación de imagen a 3D y de textura guiada por texto. Además, introducimos un método para ajustar finamente modelos de difusión latente 2D en conjuntos de datos 3D pequeños con recursos limitados, permitiendo una rápida inicialización de texto a 3D de baja resolución.
Chen et al. (Mon,) estudiaron esta cuestión.