Key points are not available for this paper at this time.
槽注意力旨在将输入图像分解为一组有意义的对象文件(槽)。这些潜在的对象表示使各种下游任务成为可能。然而,这些槽往往与对象部分绑定,而不是对象本身,尤其是在真实世界的数据集中。为了解决这个问题,我们引入了引导潜在槽扩散 - GLASS,一种对象中心模型,使用生成的标题作为指导信号,更好地将槽与对象对齐。我们的关键见解是学习生成图像空间中的槽注意力模块。这使我们能够将预训练的扩散解码器模型重新利用,该模型从槽中重建图像,并作为基于生成标题的语义掩模生成器。GLASS 学习适合多个任务的对象级表示,例如分割、图像生成和属性预测,超越了以前的方法。在对象发现方面,GLASS 在 VOC 和 COCO 数据集上,分别相对于先前的最先进(SOTA)方法实现了约 35% 和 10%的相对提高,并在基于槽注意力的方法中确立了针对条件图像生成的新 SOTA FID 分数。在分割任务中,GLASS 超越了特定为该任务设计的 SOTA 弱监督和基于语言的分割模型。
Singh 等人(周四)研究了这个问题。