Los puntos clave no están disponibles para este artículo en este momento.
Los sistemas de conducción autónoma de alto rendimiento existentes suelen depender de la estrategia de fusión multimodal para una comprensión confiable de la escena. Sin embargo, este diseño está fundamentalmente restringido debido a la falta de consideración de las fortalezas específicas de cada modalidad, lo que finalmente obstaculiza el rendimiento del modelo. Para abordar esta limitación, en este trabajo, introducimos una nueva estrategia de interacción entre modalidades que permite que las representaciones individuales por modalidad se aprendan y mantengan a lo largo del proceso, permitiendo que sus características únicas sean aprovechadas durante toda la pipeline de percepción. Para demostrar la efectividad de la estrategia propuesta, diseñamos DeepInteraction++, un marco de interacción multimodal caracterizado por un codificador de interacción representacional multimodal y un decodificador de interacción predictiva multimodal. Específicamente, el codificador se implementa como un Transformer de doble flujo con una operación de atención especializada para el intercambio e integración de información entre representaciones específicas de modalidad separadas. Nuestro aprendizaje representacional multimodal incorpora tanto alineación de características precisa basada en muestreo centrado en objetos como propagación de información densa global, esencial para la tarea de planificación más desafiante. El decodificador está diseñado para refinar iterativamente las predicciones mediante la agregación alternada de información de representaciones separadas de manera unificada y agnóstica a la modalidad, realizando interacción predictiva multimodal. Experimentos extensos demuestran el rendimiento superior del marco propuesto tanto en detección de objetos en 3D como en tareas de conducción autónoma de extremo a extremo. Nuestro código está disponible en https://github.com/fudan-zvg/DeepInteraction.
Yang et al. (Vie,) estudiaron esta cuestión.