扩散模型作为生成模型展现了令人难以置信的能力;实际上,它们驱动了当前文本条件图像生成的最先进模型,如Imagen和DALL-E 2。在本研究中,我们回顾、解密并统一扩散模型在变分和基于评分的视角下的理解。我们首先将变分扩散模型(VDM)作为马尔可夫层次变分自编码器的一种特例导出,其中三个关键假设使得ELBO的可处理计算和可扩展优化成为可能。然后,我们证明优化VDM归结为学习一个神经网络,以预测三个潜在目标之一:从任何任意噪声化的输入中恢复原始源输入,从任何任意噪声化的输入中恢复原始源噪声,或在任何任意噪声水平下噪声化输入的得分函数。接下来,我们深入探讨学习得分函数的含义,并通过Tweedie公式将扩散模型的变分视角与基于评分的生成建模视角显式连接。最后,我们介绍如何通过引导使用扩散模型学习条件分布。
Calvin Luo(周四)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: