Key points are not available for this paper at this time.
我们提出了一种根据人类指令编辑图像的方法:给定输入图像和一条指示模型该做什么的书面指令,我们的模型按照这些指令编辑图像。为了获得此问题的训练数据,我们结合了两个大型预训练模型的知识——一个语言模型(GPT-3)和一个文本到图像模型(Stable Diffusion),以生成大量图像编辑示例的数据集。我们的条件扩散模型InstructPix2Pix在生成的数据上进行训练,并能在推理时推广到真实图像和用户编写的指令。由于它在正向传递中执行编辑,并且不需要针对每个样本的微调或反演,我们的模型能够快速编辑图像,几秒钟之内完成。我们展示了针对多种输入图像和书面指令的引人注目的编辑结果.
Brooks等人(星期四)研究了这个问题。
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: