Key points are not available for this paper at this time.
知识蒸馏是指将知识从教师模型转移到学生模型,这已成为一种强大的神经机器翻译技术,用于压缩模型或简化训练目标。知识蒸馏主要包括两种方法:句子级蒸馏和标记级蒸馏。在句子级蒸馏中,学生模型的训练目标是与教师模型的输出对齐,这可以减轻训练难度,并使学生模型对全局结构有全面理解。相对而言,标记级蒸馏要求学生模型学习教师模型的输出分布,从而促进更细粒度的知识转移。研究表明,句子级蒸馏与标记级蒸馏在不同场景下的表现存在差异,这导致了对知识蒸馏方法的经验选择的困惑。在本研究中,我们认为,标记级蒸馏由于其更复杂的目标(即分布),更适合“简单”场景,而句子级蒸馏则在“复杂”场景中表现优异。为了验证我们的假设,我们通过改变学生模型的模型大小、文本的复杂性和解码过程的难度系统地分析了蒸馏方法的性能。尽管我们的实验结果验证了我们的假设,但定义特定场景的复杂性仍然是一项具有挑战性的任务。因此,我们进一步提出了一种新颖的混合方法,通过门控机制结合标记级和句子级蒸馏,旨在利用这两种单独方法的优势。实验表明,混合方法的表现超越了标记级或句子级蒸馏方法以及以往工作,验证了所提出混合方法的有效性。
Wei等人(星期二)研究了这个问题。