Key points are not available for this paper at this time.
大型语言模型(LLMs)在自然语言处理领域代表了一项突破性进展,因为它们展现了令人印象深刻的推理能力。最近,对增加这些模型的上下文长度以提高其对复杂任务适用性的兴趣显著增加。然而,在长上下文长度和大批量大小下,存储注意力键与值的键值(KV)缓存成为推理过程中内存使用的新瓶颈。为了解决这个问题,我们提出了特征注意力,旨在低秩空间中执行注意力操作,从而减少 KV 缓存内存开销。我们提出的方法与现有的 KV 缓存压缩技术是正交的,可以与其协同使用。通过对 OPT、MPT 和 Llama 模型系列的广泛实验,我们证明特征注意力可使 KV 缓存大小减少多达 40%,并使注意力操作延迟减少多达 60%,且性能下降最小。
Saxena 等人 (Sat,) 研究了这个问题。