Key points are not available for this paper at this time.
自动驾驶车辆(AV)的一个关键组成部分是能够驶向期望目的地的人工智能(AI)。如今,存在解决AI驾驶员开发的不同范式。一方面是模块化流程,它将驾驶任务分解为感知、操纵规划与控制等子任务。另一方面是端到端驾驶方法,试图学习从输入的原始传感器数据到车辆控制信号的直接映射。后者的研究相对较少,但由于其对传感器数据标注的要求较低,正变得越来越受欢迎。本文聚焦于端到端自动驾驶。到目前为止,依赖该范式的大多数方案都假设将RGB图像作为输入传感器数据。然而,AV不仅会配备摄像头,还会配备提供精确深度信息的主动传感器(例如LiDAR)。因此,本文分析了结合RGB和深度模态(即使用RGBD数据)是否能比依赖单一模态产生更好的端到端AI驾驶员。我们在多传感器和单传感器(单目深度估计)设置中,考虑了基于早期、中期和后期融合方案的多模态。利用CARLA模拟器和条件模仿学习(CIL),我们证明了早期融合多模态确实优于单模态。
Xiao et al. (Tue,) 研究了这一问题。