Key points are not available for this paper at this time.
Die semantische Segmentierung ist eine grundlegende Aufgabe in der Computer Vision, die als ein Klassifizierungsproblem pro Pixel betrachtet werden kann. In letzter Zeit haben zwar auf vollkonvolutionalen neuronalen Netzwerken (FCN) basierende Ansätze bemerkenswerte Fortschritte in dieser Aufgabe gemacht, die Aggregation von lokalen und kontextuellen Informationen in konvolutionalen Merkmalskarten bleibt jedoch ein herausforderndes Problem. In diesem Papier argumentieren wir, dass, wenn die Kategorie eines bestimmten Pixels vorhergesagt wird, die für das Ziel nahegelegenen Regionen wichtiger sind als jene, die weiter entfernt liegen. Um dieses Problem anzugehen, schlagen wir einen effektiven und gleichzeitig effizienten Ansatz namens Vortex Pooling vor, um kontextuelle Informationen effektiv zu nutzen. Empirische Studien werden ebenfalls bereitgestellt, um die Wirksamkeit der vorgeschlagenen Methode zu validieren. Konkret übertrifft unser Ansatz das vorherige State-of-the-Art-Modell namens DeepLab v3 um 1,5% auf dem PASCAL VOC 2012 Validierungssatz und um 0,6% auf dem Testsatz, indem das Atrous Spatial Pyramid Pooling (ASPP)-Modul in DeepLab v3 durch das vorgeschlagene Vortex Pooling ersetzt wird. Darüber hinaus hat unser Modell (10,13 FPS) ähnliche Rechenkosten wie DeepLab v3 (10,37 FPS).
Xie et al. (Tue,) haben diese Frage untersucht.