O modelo de difusão contínua é viável para realizar transições suavizadas para geração flexível de texto em um espaço latente contínuo. Um desafio na difusão contínua é implementar o processo de desnoising e manipular os tokens gerados para refletir fenômenos físicos nos passos de difusão em direção a uma frase contextualmente e semanticamente significativa. Basicamente, uma geração de texto de alta qualidade pode ser realizada por uma estratégia fácil-primeiro, que prioriza a geração de tokens simples ou gerais de alta frequência no início e, em seguida, tokens complexos ou específicos de baixa frequência no final, via modelo de linguagem de máscara. Este paper introduz o ruído de máscara como um estado absorvente e desenvolve um novo processo de desnoising contínuo-discreto em um modelo de difusão. Cada passo de difusão é realizado gerando seja uma incorporação de palavra contínua ou um token de máscara discreta, onde a transição latente é modelada por uma distribuição de mistura Gaussiana-Dirac. A geração de texto fácil-primeiro é então implementada e fortalecida via uma perda contrastiva para desvincular a geração entre tokens simples e complexos. Um modelo de difusão de mistura contrastiva é, portanto, explorado minimizando um limite variacional de log-verossimilhança negativa, que é regularizado alinhando a rede de desnoising posterior com a posterior Gaussiana-Dirac em cada transição de difusão com base em uma divergência Kullback-Leibler aproximada. Os experimentos em parafrasear texto e outras tarefas demonstram a eficácia e eficiência da geração de frases usando o método proposto, onde a estratégia fácil-primeiro no comportamento de geração é ilustrada.
Chien et al. (qui,) estudaram essa questão.