Key points are not available for this paper at this time.
A decodificação especulativa é uma técnica proeminente para acelerar a inferência de um grande modelo de linguagem-alvo com base nas previsões de um modelo auxiliar de esboço. Embora eficaz, em configurações específicas de aplicação, muitas vezes envolve o ajuste fino de ambos os modelos de esboço e alvo para alcançar altas taxas de aceitação. À medida que o número de tarefas posteriores cresce, esses modelos de esboço adicionam complexidade significativa aos sistemas de inferência. Propomos o Streaming Especulativo, um método de decodificação especulativa de modelo único que funde o esboço no modelo alvo, alterando o objetivo de ajuste fino de previsão do próximo token para previsão de n-grama futuro. O Streaming Especulativo acelera a decodificação em 1.8 - 3.1X em um conjunto diversificado de tarefas, como Resumo, Consultas Estruturadas e Representação de Significado, sem comprometer a qualidade da geração. Além disso, o Streaming Especulativo é eficiente em termos de parâmetros. Ele alcança acelerações equivalentes/maiores do que arquiteturas no estilo Medusa, utilizando cerca de 10000X menos parâmetros extras, tornando-o bem adequado para dispositivos com recursos limitados.
Bhendawade et al. (2024) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: