从基于流和扩散的变换器开始,多模态扩散变换器(MM-DiTs)重塑了文本到视觉的生成,因出色的视觉保真度而受到赞誉。随着这些模型的发展,用户不断通过富有想象力或稀有的提示推动边界,而先进的模型在生成这些提示时仍然存在困难,因为它们的概念往往过于稀缺,无法在预训练期间留下强烈的印记。本文提出了一种简单而有效的干预方法,在无需额外训练步骤、数据、去噪时间优化或依赖外部模块(例如,大型语言模型)的情况下,发掘MM-DiTs内部的稀有语义。特别是,MM-DiT固有的联合注意机制在整个变换器块中逐步更新文本嵌入和图像嵌入。我们发现,通过在联合注意块之前通过方差放大数学扩展文本令牌嵌入周围的表征基底,稀有语义在MM-DiT的输出中清晰显现。此外,我们的结果在文本到视觉任务中有效推广,包括文本到图像、文本到视频和文本驱动的图像编辑。我们的工作邀请生成模型揭示用户意图的语义,这些语义曾被隐藏但随时准备浮现。
Kang等人(周六)研究了这个问题。