目的扩散模型在图像生成、艺术创作等领域具有广泛的应用前景。然而,现有扩散模型存在存储开销大、推理时延长等问题。已有工作通过模型量化减少存储及推理时间消耗,但在量化过程中面临诸多挑战。一方面,噪声估计网络结构复杂,不同模块对量化误差的敏感性存在显著差异;另一方面,其多采样时间步特性使量化模型在推理时存在误差累积问题。现有量化方法未能考虑模块间量化差异和多时间步推理特性,因而量化模型性能较全精度模型仍有较大差距。为此,设计了一种分布范围动态感知的训练后量化方法。方法在校准过程中,首先基于模块的量化误差对量化参数进行选择;再基于输入激活值的分布范围对不同网络模块中的量化参数进行微调;最后,依次计算全精度扩散模型与量化模型在每个采样时间步下估计噪声之间的均方误差,抑制多采样时间步推理过程中的累积量化误差。结果在CIFAR-10(Canadian Institute for Advanced Research)、LSUN-Bedroom(large-scale scene understanding)与LSUN-Church这3个公开数据集上采用DDIM(denoising diffusion implicit model)与LDM(latent diffusion model)两种扩散模型,使用不同量化位宽(W8A8,W4A8,W6A6),并与主流扩散模型量化方法进行对比。实验结果表明,所提方法将DDIM量化至W6A6时,在CIFAR-10数据集上取得了(IS:9.40,FID:4.61)的性能表现,与全精度DDIM性能(IS:9.12,FID:4.12)相近;相较于对比量化方法,所提方法将IS(inception score)值提高了0.34,FID(Frechet inception distance score)值降低了1.96。在LSUN-Church数据集上,相较于已有工作,所提方法量化LDM至W8A8时,将FID值降低了0.34。此外,所提方法与现有量化方法结合均能进一步取得一致性提升。结论本文所提出的分布范围动态感知的训练后量化方法同时考虑了扩散模型的多时间步推理特性与模块间量化差异,显著提升了量化扩散模型在低激活比特位宽上的性能,且该方法可作为即插即用模块与已有量化方法结合取得更优的性能。
Ruiyi et al. (Thu,) studied this question.