Key points are not available for this paper at this time.
Modelos de Texto-para-Imagem (T2I) de grande escala ganharam rapidamente destaque em campos criativos, gerando saídas visualmente atraentes a partir de prompts textuais. No entanto, controlar esses modelos para garantir um estilo consistente continua sendo desafiador, com métodos existentes exigindo ajuste fino e intervenção manual para desvincular conteúdo e estilo. Neste artigo, apresentamos o StyleAligned, uma técnica nova projetada para estabelecer alinhamento de estilo entre uma série de imagens geradas. Ao empregar mínima ‘compartilhamento de atenção’ durante o processo de difusão, nosso método mantém a consistência de estilo entre as imagens dentro dos modelos T2I. Esta abordagem permite a criação de imagens consistentes em estilo usando um estilo de referência através de uma operação de inversão simples. A avaliação do nosso método em diversos estilos e prompts de texto demonstra síntese e fidelidade de alta qualidade, enfatizando sua eficácia em alcançar um estilo consistente em várias entradas.
Hertz et al. (Sun,) estudaram esta questão.