Key points are not available for this paper at this time.
近年来,由于具备全局感受野以及对输入的适应性,Transformer 网络在计算机视觉领域正开始取代纯卷积神经网络(CNN)。然而,softmax-attention 的二次计算复杂度限制了其在图像去雾任务中的广泛应用,特别是对于高分辨率图像。为了解决这一问题,我们提出了一种新的 Transformer 变体,该变体利用泰勒展开来近似 softmax-attention,并实现了线性计算复杂度。同时提出了多尺度注意力细化模块作为补充,以纠正泰勒展开的误差。此外,我们将具有多尺度 patch embedding 的多分支架构引入到所提出的 Transformer 中,通过不同尺度的重叠可变形卷积来嵌入特征。多尺度 patch embedding 的设计基于三个关键思路:1)不同大小的感受野;2)多层次语义信息;3)灵活的感受野形状。我们的模型被命名为基于泰勒公式展开的多分支 Transformer(MB-TaylorFormer),能够在 patch 嵌入阶段更灵活地嵌入由粗到细的特征,并以有限的计算成本捕获长距离像素交互。在多个去雾基准上的实验结果表明,MB-TaylorFormer 在较低的计算负担下实现了最先进(SOTA)的性能。源代码和预训练模型可在 https://github.com/FVL2020/ICCV-2023-MB-TaylorFormer 获取。
Qiu et al. (Sun,) 对这一问题进行了研究。
Synapse has enriched 2 closely related papers on similar clinical questions. Consider them for comparative context: