Los puntos clave no están disponibles para este artículo en este momento.
Consideramos el problema de ajustar un modelo de aprendizaje por refuerzo (RL) a algunos datos de comportamiento dados en un entorno de bandit de múltiples brazos. Estos modelos han recibido mucha atención en los últimos años por su carácter en la toma de decisiones humanas y animales. Proporcionamos una formulación genérica de problema de optimización matemática para el problema de ajuste de una amplia gama de modelos de RL que aparecen frecuentemente en aplicaciones de investigación científica. Luego ofrecemos un análisis teórico detallado de sus propiedades de convexidad. Basado en los resultados teóricos, introducimos un nuevo método de solución para el problema de ajuste de modelos de RL basado en relajación convexa y optimización. Nuestro método se evalúa en varios entornos de bandit simulados y del mundo real para comparar con algunos métodos de referencia que aparecen en la literatura. Los resultados numéricos indican que nuestro método logra un rendimiento comparable al estado del arte, al tiempo que reduce significativamente el tiempo de computación. También proporcionamos un paquete de Python de código abierto para nuestro método propuesto para empoderar a los investigadores a aplicarlo en el análisis de sus conjuntos de datos directamente, sin conocimiento previo de optimización convexa.
Zhu et al. (Thu,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: