Ereigniskameras bieten einen vielversprechenden Ansatz für die Tiefenschätzung in Mehransichts-Stereo und Simultane Lokalisierung und Kartierung (SLAM) aufgrund ihrer Fähigkeit, unscharfe 3D-Kanten in hoher Geschwindigkeit und unter breiten Beleuchtungsbedingungen zu erkennen. Traditionelle Deep-Learning-Frameworks, die für herkömmliche Kameras entwickelt wurden, haben jedoch Schwierigkeiten mit der asynchronen, streamähnlichen Natur von Ereignisdaten, da ihre Architekturen für diskrete, bildähnliche Eingaben optimiert sind. Wir schlagen ein skalierbares, flexibles und anpassungsfähiges Framework für die pixelgenaue Tiefenschätzung mit Ereigniskameras in sowohl monokularen als auch stereoskopischen Konfigurationen vor. Die 3D-Szenenstruktur wird in Disparitätsraum-Bilder (DSIs) kodiert, die räumliche Dichten von Strahlen darstellen, die durch Rückprojektion von Ereignissen in den Raum über bekannte Kameraposen gewonnen werden. Unser neuronales Netzwerk verarbeitet lokale Teilregionen der DSIs und kombiniert 3D-Faltungsschichten mit einer rekurrenten Struktur, um wertvolle Muster für die Tiefenvorhersage zu erkennen. Die lokale Verarbeitung ermöglicht eine schnelle Inferenz mit voller Parallelisierung und sorgt für eine konstant extrem niedrige Modellkomplexität und Speicherkosten, unabhängig von der Kamerarauflösung. Experimente an Standardbenchmarks (MVSEC- und DSEC-Datensätze) zeigen eine bisher unerreichte Effektivität: (i) mit rein monokularen Daten erzielt unsere Methode vergleichbare Ergebnisse zu bestehenden Stereo-Methoden; (ii) bei Anwendung auf Stereo-Daten übertrifft sie alle aktuellen (SOTA) Ansätze erheblich und reduziert den mittleren absoluten Fehler um mindestens 42%; (iii) unsere Methode ermöglicht auch eine Steigerung der Tiefenkomplettheit um mehr als das Dreifache, während sie gleichzeitig den medianen absoluten Fehler um mindestens 30% reduziert. Angesichts ihrer bemerkenswerten Leistung und der effektiven Verarbeitung von Ereignisdaten hat unser Framework großes Potenzial, ein Standardansatz für die Anwendung von Deep Learning für ereignisbasiertes Tiefenabschätzen und SLAM zu werden. Projektseite: https://github.com/tub-rip/DERD-Net
Hitzges et al. (Dienstag) haben diese Frage untersucht.