Key points are not available for this paper at this time.
Modelos de linguagem grande (LLMs) representam um avanço revolucionário no domínio do processamento de linguagem natural devido às suas impressionantes habilidades de raciocínio. Recentemente, houve um interesse considerável em aumentar os comprimentos de contexto para esses modelos a fim de melhorar sua aplicabilidade em tarefas complexas. No entanto, em longos comprimentos de contexto e grandes tamanhos de lote, o cache de chave-valor (KV), que armazena as chaves e valores da atenção, surge como o novo gargalo no uso da memória durante a inferência. Para resolver isso, propomos a Atenção Eigen, que realiza a operação de atenção em um espaço de baixa classificação, reduzindo assim a sobrecarga de memória do cache KV. Nossa abordagem proposta é ortogonal às técnicas existentes de compressão de cache KV e pode ser utilizada sinergicamente com elas. Através de extensos experimentos nas famílias de modelos OPT, MPT e Llama, demonstramos que a Atenção Eigen resulta em uma redução de até 40% nos tamanhos do cache KV e até 60% na latência da operação de atenção, com uma queda mínima no desempenho.
Saxena et al. (Sat,) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: