Key points are not available for this paper at this time.
3D visuelle Wahrnehmungsaufgaben, einschließlich 3D-Erkennung und Kartensegmentierung basierend auf Multi-Kamera-Bildern, sind essenziell für autonome Fahrsysteme. In dieser Arbeit stellen wir ein neues Framework namens BEVFormer vor, das einheitliche BEV-Darstellungen mit spatiotemporalen Transformern lernt, um mehrere Wahrnehmungsaufgaben des autonomen Fahrens zu unterstützen. Kurz gesagt, nutzt BEVFormer sowohl räumliche als auch zeitliche Informationen, indem es mit dem räumlichen und zeitlichen Raum über vordefinierte gitterförmige BEV-Abfragen interagiert. Um räumliche Informationen zu aggregieren, entwerfen wir eine räumliche Kreuzaufmerksamkeit, bei der jede BEV-Abfrage die räumlichen Merkmale aus den Interessensregionen über die Kamerasuiten extrahiert. Für zeitliche Informationen schlagen wir zeitliche Selbstaufmerksamkeit vor, um die historische BEV-Information wiederholt zu fusionieren. Unser Ansatz erreicht einen neuen Stand der Technik von 56,9 % in Bezug auf die NDS-Metrik im nuScenes-Testdatensatz, was 9,0 Punkte höher ist als die vorherige Bestleistung und gleichwertig mit der Leistung von LiDAR-basierten Baselines. Darüber hinaus zeigen wir, dass BEVFormer die Genauigkeit der Geschwindigkeitsabschätzung und die Rückrufquote von Objekten unter schlechten Sichtbedingungen bemerkenswert verbessert. Der Code ist verfügbar unter https://github.com/zhiqi-li/BEVFormer.
Li et al. (Do,) haben diese Frage untersucht.