像 CLIP 这样的视觉-语言模型 (VLMs) 通过对比学习实现跨模态语义对齐,表现出强大的零-shot 泛化能力。然而,传统的提示工程主要依赖粗粒度类别标签,忽视了细粒度的局部语义。现有的方法假设 VLM 自然能够识别局部视觉细节,并试图通过用大型语言模型生成的属性描述符增强分类效果。然而,我们的系统实验揭示了关键限制:CLIP 对全局图像模式的强烈偏向妨碍了其处理局部视觉描述符的能力。为了解决这一基本限制,我们提出了一种简单、有效且即插即用的解决方案,使 CLIP 能够“同时看到森林和树木”。具体而言,我们采用随机多重裁剪增强,以激活 CLIP 对局部特征分析的潜能。通过仅裁剪部分区域,该方法有效限制了模型的感受野,并重新校准其注意力机制,从而减轻了其固有偏见。我们在零-shot、少-shot和测试时间适应环境下评估所提方法,广泛实验表明 D&D 实现了令人满意的性能。
Xue 等 (Fri,) 研究了这个问题。