Key points are not available for this paper at this time.
文本驱动的扩散模型通过使用文本提示作为输入,显著提高了图像编辑性能。文本驱动图像编辑的一个关键步骤是将原始图像反演为受源提示条件的潜在噪声编码。虽然以往的方法通过重构图像合成过程取得了令人满意的结果,但反演的潜在噪声编码与源提示紧密耦合,这限制了通过目标文本提示的图像可编辑性。为了解决这个问题,我们提出了一种新颖的方法,称为源提示解耦反演(SPDInv),旨在减少源提示的影响,从而通过采用扩散模型增强文本驱动的图像编辑性能。为了使反演的噪声编码在尽可能多的程度上独立于给定的源提示,我们指出迭代反演过程应满足一个不动点约束。因此,我们将反演问题转化为寻找固定点解的问题,并利用预训练的扩散模型来促进搜索过程。实验结果表明,我们提出的SPDInv方法能够有效减轻目标编辑提示与源提示之间的冲突,从而显著减少编辑伪影。除了文本驱动的图像编辑外,借助SPDInv,我们可以轻松适应定制的图像生成模型以进行本地化编辑任务,并取得良好的性能。源代码可在 https://github.com/leeruibin/SPDInv 获取。
李等(Sun,)研究了这个问题。