Key points are not available for this paper at this time.
持续学习(CL)对于语言模型动态适应不断变化的现实世界需求至关重要。为了减轻持续学习中的灾难性遗忘问题,数据重放已被证明是一种简单而有效的策略,而后续基于数据重放的蒸馏可以进一步提升性能。然而,现有方法未能充分利用模型从以前任务中嵌入的知识,导致需要相对较多的重放样本才能取得良好的结果。在本研究中,我们首先探索并强调注意力权重在知识保留中的重要性,然后提出了一种基于选择性注意力的知识保留方法(SEEKR),以实现大语言模型(LLMs)的数据高效重放持续学习。具体而言,SEEKR在选择的注意力头上进行注意力蒸馏,以实现更细粒度的知识保留,采用提出的可遗忘性和任务敏感性度量来识别最有价值的注意力头。在两个大语言模型的持续学习基准上的实验结果表明,SEEKR在性能和效率上优于现有方法。明确而言,SEEKR在只使用其他方法的1/10重放数据的情况下,取得了相当甚至更好的性能,并将重放数据的比例降至1%。代码可在 https://github.com/jinghan1he/SEEKR 获取.
He 等 (Mon,) 研究了这个问题。