开放词汇语义分割(OVSS)旨在通过任意自然语言描述实现像素级物体分割。尽管预训练的视觉-语言模型(VLMs)显著推动了OVSS的发展,但它们对视觉变换器(ViT)架构的依赖对密集预测施加了基本限制。具体而言,基于ViT的VLM缺乏层次下采样,导致单尺度表示在空间定位和全局语义之间进行权衡。为了解决这些问题,本文提出了一种用于OVSS的层次边界约束解码网络,称为CLIP-HBD。我们的方法利用VLM语义先验重构多尺度特征,并引入边界约束解码策略以细化边缘细节。具体而言,CLIP-HBD利用基于ConvNeXt的骨干网以及层次适应机制融合多层VLM特征,从而生成全面的多尺度表示。为了解决边界不准确的问题,我们基于多尺度表示进行显式边界预测,随后将生成的边界图转换为结构约束,引导解码器将重点放在边界区域。通过将结构约束与层次特征结合,解码过程有效地保持了语义一致性并恢复了精确的物体边界。大量实验表明,CLIP-HBD在多个基准测试中,在分割精度和边界质量上均表现出优越性能。
Wáng等人(周五)研究了这个问题。