内窥镜图像分割在帮助医生准确定位病灶和提高诊断效率方面发挥着关键作用。然而,现有方法在同时利用局部细节和全局语义信息方面不足,这使得有效分割具有复杂形态、模糊边界和相似纹理的器官和组织变得困难。因此,我们在本文中提出了一种渐进融合网络(PFNet)。首先,PFNet使用以Transformer为骨干编码器的Pvtv2来捕获多尺度的全局特征。其次,设计了一个噪声过滤注意模块(NFAM)来抑制噪声并增强编码器输出的多级特征的语义。然后,提出了一个边界和位置感知模块(BLAM),通过将深层全局特征与浅层局部细节相结合来生成高质量的边界和位置信息。接着,设计了一个辅助信息嵌入模块(AIEM),以动态方式将边界和位置信息嵌入每一层特征,从而增强解码过程的上下文感知能力。最后,特征融合模块(FFM)通过逐层迭代补充边界和位置信息,以确保全局语义与局部细节的协同恢复。通过广泛的实验,我们证明了所提出的PFNet在Ureter、Re-TMRS、Kvasir、CVC-ClinicDB、CVC-ColonDB、ETIS和CVC-300等数据集的分割性能上优于当前最新的(SOTA)方法。特别是在Re-TMRS数据集上,mDice达到了91.07%;在CVC-ClinicDB数据集上,mDice达到了93.09%。
Fu et al. (Fri,) 研究了这个问题。