Los puntos clave no están disponibles para este artículo en este momento.
La abstracción de estado segura en el aprendizaje por refuerzo permite que un agente ignore aspectos de su estado actual que son irrelevantes para su decisión actual y, por lo tanto, acelera la programación dinámica y el aprendizaje. Este documento explora la abstracción de estado segura en el aprendizaje por refuerzo jerárquico, donde los comportamientos aprendidos deben ajustarse a un programa jerárquico parcial dado. A diferencia de enfoques anteriores a este problema, nuestros métodos ofrecen una abstracción de estado significativa mientras mantienen la optimalidad jerárquica, es decir, la optimalidad entre todas las políticas consistentes con el programa parcial. Mostramos cómo lograr esto para un lenguaje de programación parcial que es esencialmente Lisp aumentado con constructos no deterministas. Demostramos nuestros métodos en dos variantes del dominio de taxis de Dietterich, mostrando cómo la abstracción de estado y la optimalidad jerárquica resultan en un aprendizaje más rápido de mejores políticas y permiten la transferencia de habilidades aprendidas de un problema a otro.
André et al. (Sun,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: