Key points are not available for this paper at this time.
Die Übernahme von auf Vision Transformers (ViTs) basierenden Architekturen stellt einen bedeutenden Fortschritt in der 3D-Medizinbild (MI) Segmentierung dar und übertrifft traditionelle Convolutional Neural Network (CNN) Modelle durch die Verbesserung des globalen kontextuellen Verständnisses. Während dieser Paradigmenwechsel die Leistung der 3D-Segmentierung erheblich verbessert hat, erfordern moderne Architekturen äußerst große und komplexe Strukturen sowie umfangreiche Rechenressourcen für Training und Implementierung. Darüber hinaus können größere Modelle im Kontext begrenzter Datensätze, wie sie häufig in der medizinischen Bildgebung vorkommen, sowohl hinsichtlich der Modellen generalisierung als auch der Konvergenz Hürden darstellen. Als Antwort auf diese Herausforderungen und um zu demonstrieren, dass leichte Modelle ein wertvoller Forschungsbereich in der 3D-Medizinbildgebung sind, präsentieren wir SegFormer3D, einen hierarchischen Transformer, der die Aufmerksamkeit über multiskalare volumetrische Merkmale berechnet. Außerdem vermeidet SegFormer3D komplexe Decoder und verwendet einen all-MLP-Decoder, um lokale und globale Aufmerksamkeitsmerkmale zu aggregieren und hochgenaue Segmentierungsmasken zu erzeugen. Der vorgeschlagene speichereffiziente Transformer bewahrt die Leistungsmerkmale eines erheblich größeren Modells in einem kompakten Design. SegFormer3D demokratisiert Deep Learning für die 3D-Medizinbildsegmentierung, indem er ein Modell mit 33x weniger Parametern und einer 13x Reduktion in GFLOPS im Vergleich zum aktuellen Stand der Technik (SOTA) bietet. Wir vergleichen SegFormer3D mit den aktuellen SOTA-Modellen auf drei weit verbreiteten Datensätzen: Synapse, BRaTs und ACDC, und erzielen wettbewerbsfähige Ergebnisse. Code: https://github.com/OSUPCVLab/SegFormer3D.git
Perera et al. (Mon,) haben diese Frage untersucht.