Los entornos parcialmente observables presentan un considerable desafío computacional en el aprendizaje por refuerzo debido a la necesidad de considerar largas historias. Aprender con una ventana finita de observaciones rápidamente se vuelve intractable a medida que aumenta la longitud de la ventana. En este trabajo, introducimos trazas de memoria. Inspiradas en las trazas de elegibilidad, estas son representaciones compactas de la historia de observaciones en forma de promedios móviles exponenciales. Probamos límites de complejidad de muestra para el problema de evaluación en línea fuera de política que cuantifican los errores de retorno logrados con trazas de memoria para la clase de estimaciones de valor continuas de Lipschitz. Establecemos una conexión estrecha con el enfoque de ventana y demostramos que, en ciertos entornos, aprender con trazas de memoria es significativamente más eficiente en términos de muestra. Finalmente, subrayamos la efectividad de las trazas de memoria empíricamente en experimentos de aprendizaje por refuerzo en línea tanto para la predicción de valores como para el control.
Eberhard et al. (Wed,) estudiaron esta pregunta.