Neste trabalho, fornecemos uma revisão sistemática dos Modelos de Linguagem de Difusão Discreta (dLLMs) e dos Modelos de Linguagem Multimodal de Difusão Discreta (dMLLMs). Ao contrário dos modelos autoregressivos (AR), os dLLMs e dMLLMs adotam um paradigma de decodificação em paralelo com múltiplos tokens, utilizando atenção plena e uma estratégia de geração baseada em desnoising. Este paradigma permite naturalmente a geração paralela, controle de saída detalhado e percepção dinâmica. Essas capacidades eram anteriormente difíceis de alcançar com modelos AR. Um número crescente de d (M) LLMs proprietários em escala industrial, bem como um grande número de d (M) LLMs acadêmicos de código aberto, demonstraram desempenho comparável aos seus equivalentes autoregressivos, enquanto alcançam até 10 vezes de aceleração na velocidade de inferência. Esses desenvolvimentos posicionam os modelos de difusão discreta como uma alternativa promissora à inteligência baseada na abordagem autoregressiva tradicional. Neste trabalho, apresentamos uma visão abrangente da pesquisa nos domínios de dLLM e dMLLM. Rastreamos o desenvolvimento histórico dos dLLMs e dMLLMs, formalizamos as estruturas matemáticas subjacentes, listamos métodos de modelagem comumente usados e categorizamos modelos representativos. Além disso, analisamos técnicas-chave para treinamento, inferência e quantização. Também discutimos questões de confiabilidade e resumimos aplicações emergentes nos domínios de linguagem, linguagem-visual e biológica, entre outros. Concluímos discutindo direções futuras para pesquisa e implementação. Artigos relativos estão coletados em https://github.com/LiQiiiii/Awesome-Discrete-Diffusion-LLMMLLM.
Yu et al. (Mon,) estudaram esta questão.