Key points are not available for this paper at this time.
视觉识别的“喧嚣20年代”始于视觉变换器(ViTs)的引入,它迅速取代了卷积神经网络作为最先进的图像分类模型。然而,普通的ViT在应用于一般计算机视觉任务(如目标检测和语义分割)时面临困难。层次化变换器(例如,Swin变换器)重新引入了几个卷积神经网络的先验,使变换器在作为通用视觉骨干网络时切实可行,并在各种视觉任务上展现出了显著的表现。然而,这些混合方法的有效性仍然主要归功于变换器的内在优越性,而不是卷积的固有诱导偏差。在这项工作中,我们重新审视设计空间,并测试纯卷积神经网络能够达到的极限。我们逐步“现代化”标准ResNet,以设计视觉变换器,并在此过程中发现了几个关键组件,这些组件对性能差异产生了影响。这次探索的结果是一系列称为ConvNeXt的纯卷积神经网络模型。ConvNeXt完全由标准卷积神经网络模块构建,在准确性和可扩展性方面与变换器竞争,达到了87.8%的ImageNet top-1准确率,并在COCO检测和ADE20K分割中超过了Swin变换器,同时保持了标准卷积神经网络的简单性和效率。
刘等(Mon,)研究了这个问题。