Key points are not available for this paper at this time.
多查询注意力(MQA)仅使用单个键值头,大大加快了解码器推理的速度。然而,MQA可能导致质量下降,并且仅为更快推理而训练一个单独的模型也可能不是很理想。我们(1)提出了一种利用原始预训练计算的5%将现有多头语言模型检查点转化为具有MQA的模型的方案,并(2)引入了分组查询注意力(GQA),这是多查询注意力的一个推广,它使用中间数量的键值头(超过一个,少于查询头的数量)。我们表明,经过提升训练的GQA在质量方面接近多头注意力,并且速度与MQA相当。
Ainslie等人(Sun)研究了这个问题。