Key points are not available for this paper at this time.
通过应用广泛的正则化方法,例如限制函数空间、在训练过程中注入随机性、增强数据等,深度神经网络的泛化能力得到了显著提高。在这项工作中,我们提出了一种简单而有效的正则化方法,称为渐进自我知识蒸馏(PS-KD),该方法在训练过程中逐步蒸馏模型自身的知识,以软化硬目标(即独热编码向量)。因此,它可以在知识蒸馏的框架中被解释为学生自身变成教师。具体而言,目标通过结合真实值和模型自身的过去预测进行自适应调整。我们表明,PS-KD通过根据分类示例的难度重新缩放梯度,提供了硬样本挖掘的效果。该方法适用于任何具有硬目标的监督学习任务,并且可以与现有的正则化方法轻松结合,以进一步增强泛化性能。此外,已确认PS-KD不仅实现了更好的准确性,还在校准和序列排名方面提供了高质量的置信度估计。在三个不同任务(图像分类、目标检测和机器翻译)上的大量实验结果表明,我们的方法持续改善了最先进基线的性能。代码可在 https://github.com/lgcnsai/PS-KD-Pytorch 获得。
金等(周五)研究了这个问题。