Key points are not available for this paper at this time.
在下游任务上微调大型预训练语言模型已经成为自然语言处理中的事实学习模式。然而,传统方法微调预训练模型的所有参数,这在模型规模和任务数量增加时变得不可承受。最近的研究提出了各种参数高效的迁移学习方法,只微调少量(额外的)参数以获得强大的性能。尽管有效,但成功的关键因素以及各种方法之间的联系仍然缺乏理解。在本文中,我们分析了最先进的参数高效迁移学习方法的设计,并提出了一个统一框架,建立它们之间的联系。具体而言,我们将它们重新框架为对预训练模型中特定隐藏状态的修改,并定义了一组设计维度,其中不同的方法有所不同,例如计算修改的函数和应用修改的位置。通过在机器翻译、文本摘要、语言理解和文本分类基准上进行全面的实证研究,我们利用统一视角识别以前方法中的重要设计选择。此外,我们的统一框架使得不同方法之间的设计元素能够相互迁移,因此我们能够实例化新的参数高效微调方法,这些方法调节的参数少于以前的方法,同时更有效,在所有四个任务上获得与微调所有参数相当的结果。
何等人等(星期五)研究了这个问题。