La conducción autónoma robusta bajo disturbios adversarios sigue siendo un desafío fundamental, ya que los marcos convencionales de aprendizaje por refuerzo profundo (DRL) presentan una convergencia frágil y una resiliencia limitada a cambios de distribución. Este estudio presenta el Crítico Suave Mejorado por Recompensa Adaptativa a Adversarios (AARE-SAC), que reconceptualiza el SAC como un sistema de control autorregulado jerárquicamente. Dentro de este paradigma, el error de diferencia temporal funciona como una variable de retroalimentación meta que modula de manera adaptativa la dinámica del aprendizaje, la valoración de recompensas y la respuesta adversaria, formando un bucle de auto-estabilización que internaliza la robustez. Experimentos en diversos entornos urbanos de CARLA demuestran que AARE-SAC logra una convergencia más rápida y suave con una estabilidad y seguridad notablemente mejoradas. Los análisis de ablación confirman que su ventaja proviene del acoplamiento sinérgico entre la regulación adaptativa y la exposición adversaria, transformando la robustez de un salvaguarda reactiva en una propiedad intrínseca del aprendizaje. Estos hallazgos establecen AARE-SAC como un marco unificado para lograr estabilidad, eficiencia y resiliencia en la conducción autónoma crítica para la seguridad.
Yuan et al. (2026) estudiaron esta pregunta.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: