Key points are not available for this paper at this time.
批量归一化(BN)最近已成为加速和改善深度神经网络(DNNs)训练的标准组件。然而,BN引入了额外的计算,消耗更多内存,并显著减慢训练迭代。此外,归一化过程中的非线性平方和平方根操作妨碍了低位宽量化技术,这在深度学习硬件社区引起了极大关注。本文提出了一种仅在训练期间前向和后向传播中使用线性操作的 L1 范数批量归一化(L1BN)。 L1BN 通过乘以相当于 (/2) ^1/2 的缩放因子,近似等同于传统的 L2 范数批量归一化(L2BN)。在各种卷积神经网络和生成对抗网络上的实验表明,L1BN 能够维持与 L2BN 相同的性能和收敛速率,但具有更高的计算效率。在减少资源的实际应用专用集成电路合成中,与原始 L2BN 相比,L1BN 实现了 25% 的加速和 37% 的节能。我们这种适合硬件的归一化方法不仅在速度上超越了 L2BN,还简化了深度学习加速器的设计。最后但同样重要的是,L1BN 有望实现深度神经网络的全量化训练,赋予未来移动设备上的人工智能应用以迁移和持续学习能力。
Wu 等(星期五)研究了这个问题。