Key points are not available for this paper at this time.
注意机制是大型语言模型(LLMs)的关键组成部分,它允许序列中的标记相互作用,但不依赖于顺序。引入位置编码(PE)使得按位置进行处理成为可能,例如关注第 i 个标记。然而,目前的 PE 方法使用标记计数来推导位置,因此无法推广到更高的抽象层次,例如关注第 i 句。在本文中,我们提出了一种新的位置编码方法:上下文位置编码(CoPE),它允许位置根据上下文进行调节,仅在模型确定的特定标记上递增位置。这使得更一般的位置寻址变得可行,例如关注特定的第 i 个词、名词或句子。我们展示了 CoPE 能够解决选择性复制、计数和翻转任务,而流行的位置嵌入方法无法做到,并且改善了语言建模和编码任务的困惑度。
Golovneva 等人(周二)研究了这个问题。