Resumen El aprendizaje reforzado profundo se aplica ampliamente en problemas de planificación de movimiento para sistemas autónomos debido a su naturaleza libre de modelo y su capacidad para resolver problemas de control complejos a través de prueba y error. Sin embargo, el éxito del aprendizaje reforzado profundo depende en gran medida de la política de exploración y del diseño de la función de recompensa. Esta dependencia hace que sea un desafío resolver problemas de planificación a largo plazo y requiere un diseño cuidadoso de la función de recompensa para evitar el problema de recompensa escasa. En este artículo, proponemos un marco mejorado de aprendizaje reforzado profundo que aprende la política de acción de planificación de alto nivel mientras considera las propiedades de control de bajo nivel y mejora la eficiencia de entrenamiento y la optimalidad de navegación. La política de alto nivel permite al agente tomar decisiones a largo plazo con un horizonte flexible. Usar una política de alto nivel también mitiga el problema de recompensa escasa en tareas de planificación a largo plazo. Al almacenar solo acciones y transiciones de alto nivel en el buffer de experiencia, el agente puede aprender de manera eficiente en tareas de planificación de trayectoria a largo plazo. La arquitectura paralela propuesta con redes neuronales separadas de actor y crítico permite la integración de transferencia de conocimiento de alto nivel mientras se mantiene la capacidad de generar nuevo conocimiento adaptado a problemas específicos. Integrar demostraciones en línea durante el entrenamiento utilizando algoritmos de planificación global puede mejorar significativamente la calidad de las experiencias empleadas durante el aprendizaje reforzado. Los resultados experimentales muestran que transferir conocimiento geométrico de alto nivel y aplicar corrección de errores en línea a través de demostraciones puede mejorar significativamente el rendimiento del agente en tareas de planificación de trayectoria a largo plazo.
Hu et al. (2026) estudiaron esta cuestión.