Los puntos clave no están disponibles para este artículo en este momento.
Los modelos de difusión representan un nuevo paradigma en la generación de texto a imagen. Más allá de generar imágenes de alta calidad a partir de indicaciones textuales, modelos como Stable Diffusion se han extendido con éxito a la generación conjunta de pseudo-máscaras de segmentación semántica. Sin embargo, las extensiones actuales dependen principalmente de la extracción de atenciones vinculadas a las palabras clave utilizadas para la síntesis de imágenes. Este enfoque limita la generación de máscaras de segmentación derivadas de tokens de palabras que no están contenidas en la indicación textual. En este trabajo, introducimos Mapas de Atención de Vocabulario Abierto (OVAM) - un método sin entrenamiento para modelos de difusión de texto a imagen que permite la generación de mapas de atención para cualquier palabra. Además, proponemos un proceso de optimización ligero basado en OVAM para encontrar tokens que generen mapas de atención precisos para una clase de objeto con una sola anotación. Evaluamos estos tokens dentro de las extensiones existentes de vanguardia de Stable Diffusion. El modelo que mejor funciona mejora su mIoU de 52.1 a 86.6 para las pseudo-máscaras de imágenes sintéticas, demostrando que nuestros tokens optimizados son una forma eficiente de mejorar el rendimiento de los métodos existentes sin cambios arquitectónicos ni reentrenamiento.
Marcos-Manchón et al. (Jue,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: