Los puntos clave no están disponibles para este artículo en este momento.
Presentamos SegFormer, un marco de segmentación semántica simple, eficiente y poderoso que unifica Transformers con decodificadores livianos de perceptrón multicapa (MLP). SegFormer tiene dos características atractivas: 1) SegFormer comprende un nuevo codificador Transformer estructurado jerárquicamente que produce características multiescala. No necesita codificación posicional, evitando así la interpolación de códigos posicionales que conduce a un rendimiento disminuido cuando la resolución de prueba difiere de la de entrenamiento. 2) SegFormer evita decodificadores complejos. El decodificador MLP propuesto agrega información de diferentes capas, combinando así tanto atención local como atención global para generar representaciones poderosas. Demostramos que este diseño simple y liviano es la clave para una segmentación eficiente en Transformers. Escalamos nuestro enfoque para obtener una serie de modelos desde SegFormer-B0 hasta SegFormer-B5, alcanzando un rendimiento y eficiencia significativamente mejores que los métodos anteriores. Por ejemplo, SegFormer-B4 logra un 50.3% de mIoU en ADE20K con 64M de parámetros, siendo 5 veces más pequeño y un 2.2% mejor que el mejor método anterior. Nuestro mejor modelo, SegFormer-B5, logra un 84.0% de mIoU en el conjunto de validación de Cityscapes y muestra una excelente robustez en zero-shot en Cityscapes-C. El código se publicará en: github.com/NVlabs/SegFormer.
Xie et al. (Mon,) estudiaron esta cuestión.
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: