Los puntos clave no están disponibles para este artículo en este momento.
Los procesos de decisión de Markov robustos (MDPs) tienen como objetivo encontrar una política que optimice el rendimiento en el peor de los casos sobre un conjunto de incertidumbre de MDPs. Los estudios existentes se han centrado principalmente en los MDPs robustos bajo el criterio de recompensa descontada, dejando los de bajo el criterio de recompensa promedio en gran medida inexplorados. En este trabajo, desarrollamos el primer estudio integral y sistemático de los MDPs robustos con recompensa promedio, donde el objetivo es optimizar el rendimiento promedio a largo plazo en el peor de los casos. Nuestras contribuciones son cuatro: (1) demostramos la convergencia uniforme de la función de valor descontado robusta a la función de recompensa promedio robusta a medida que el factor de descuento γ se acerca a 1; (2) derivamos la ecuación de Bellman de recompensa promedio robusta, caracterizamos la estructura de su conjunto de soluciones y probamos la equivalencia entre resolver la ecuación de Bellman robusta y encontrar la política robusta óptima; (3) diseñamos algoritmos de programación dinámica robustos y caracterizamos teóricamente su convergencia hacia la política óptima; y (4) diseñamos dos algoritmos sin modelo utilizando el enfoque de Monte-Carlo de múltiples niveles y probamos su convergencia asintótica.
Wang et al. (Sun,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: