BEVFormer: Erlernen der Vogelperspektivenrepräsentation aus Multi-Kamera-Bildern mittels spatiotemporaler Transformers | Synapse