A percepção em visão de pássaro (BEV) emergiu como uma representação chave para a compreensão unificada de cena na condução autônoma. No entanto, os métodos BEV atuais que dependem apenas de câmeras monoculares enfrentam severa degradação sob condições climáticas adversas e cenas dinâmicas devido a pistas de profundidade limitadas e dependência de iluminação. Para enfrentar esses desafios, propomos uma estrutura robusta de percepção BEV multimodal que integra radar de onda milimétrica 4D de dupla fonte e imagens de câmeras em múltiplas visões. A arquitetura proposta explora sistematicamente a velocidade Doppler e informações temporais do radar 4D para modelar o movimento de objetos dinâmicos, enquanto introduz uma estratégia de fusão deformável no espaço BEV para um alinhamento semântico preciso entre as modalidades. Nosso design inclui quatro módulos principais: um Codificador de Radar Consciente de Doppler (DARE) que aprimora características sensíveis ao movimento por meio de atenção guiada por velocidade; um Módulo de Denoising de Características Consciente de Névoa (FADM) que suprime a inconsistência da modalidade em condições de baixa visibilidade através de atenção cruzada entre modalidades e melhoria residual; um Módulo de Fusão Temporal Multimodal (TFM) que codifica sequências temporais do radar usando um codificador Transformer para modelagem de continuidade de movimento; e uma perda de múltiplas tarefas consciente de confiança que supervisiona conjuntamente a segmentação semântica, a estimativa de movimento e a detecção de objetos. Extensos experimentos no conjunto de dados DualRadar e simulações em clima adverso demonstram que nosso método alcança ganhos significativos em comparação com as melhores linhas de base em precisão de segmentação BEV, robustez de detecção e estabilidade de movimento. A estrutura proposta oferece uma solução escalável e resiliente para percepção autônoma no mundo real, especialmente sob condições ambientais desafiadoras.
LI et al. (2026) estudaram essa questão.