Key points are not available for this paper at this time.
虽然变换器已经彻底改变了深度学习,但其二次注意力复杂度限制了其处理无限长输入的能力。我们提出了反馈注意力记忆(FAM),一种新颖的变换器架构,它利用反馈回路使网络能够关注其自身的潜在表示。这种设计促进了变换器内工作记忆的出现,使其能够处理无限长的序列。TransformerFAM不需要额外的权重,能够与预训练模型无缝集成。我们的实验表明,TransformerFAM在各种模型规模(1B、8B和24B)上的长上下文任务中显著提高了变换器的性能。这些结果展示了赋予大型语言模型(LLM)处理无限长度序列的潜力。
Hwang等(Sun,)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: