Key points are not available for this paper at this time.
遥感城市场景图像的语义分割在土地覆盖制图、城市变化检测和环境保护等领域具有广泛的需求。随着深度学习的发展,基于卷积神经网络(CNN)的方法因其表征分层特征信息的强大能力而占据主导地位。然而,卷积操作本身的局限性限制了网络提取全局上下文信息的能力。近年来,随着 Transformer 在计算机视觉领域的成功应用,Transformer 在建模全局上下文信息方面展现出了巨大潜力。然而,Transformer 在捕获局部细节信息方面的能力仍显不足。在本文中,为了探索 CNN 与 Transformer 联合机制在遥感城市场景语义分割中的潜力,我们提出了一种基于编码-解码的 CNN 与 Transformer 多尺度融合网络(CTMFNet),用于城市场景理解。为了更有效地耦合局部-全局上下文信息,我们设计了一个双主干注意力融合模块(DAFM),用以耦合双分支编码器的局部与全局上下文信息。此外,为了弥合不同尺度之间的语义鸿沟,我们构建了一个多层稠密连接网络(MDCN)作为解码器。MDCN 使多尺度之间的语义信息能够通过上采样和残差连接充分流动并相互融合。我们在国际摄影测量与遥感学会(ISPRS)Vaihingen 和 ISPRS Potsdam 数据集上进行了广泛的主客观对比实验及消融实验。大量实验结果证明,与目前流行的方法相比,我们的方法具有优越性。
Song et al. (Mon,) 研究了这一问题。