Los puntos clave no están disponibles para este artículo en este momento.
El valor presente de las recompensas asociadas con un proceso de Markov en tiempo discreto tiene una distribución de probabilidad que depende del estado inicial. La primera parte del documento aplica la teoría de puntos fijos a un sistema de ecuaciones para las funciones de distribución del valor presente. La segunda parte del documento expande el modelo a un proceso de decisión de Markov (MDP) y considera la maximización de la utilidad esperada del valor presente cuando la función de utilidad es exponencial.
Chung et al. (Thu,) estudiaron esta cuestión.