Los puntos clave no están disponibles para este artículo en este momento.
El aprendizaje por refuerzo es un marco teórico que describe cómo los agentes aprenden a seleccionar opciones que maximizan recompensas y minimizan castigos a lo largo del tiempo. Sin embargo, a menudo tomamos decisiones para obtener refuerzos simbólicos (por ejemplo, dinero, puntos) que luego se intercambian por refuerzos primarios (por ejemplo, comida, bebida). Aunque los refuerzos simbólicos son omnipresentes en nuestras vidas diarias y se utilizan ampliamente en tareas de laboratorio debido a que pueden ser motivadores, los mecanismos por los cuales se convierten en motivadores se entienden menos. En el presente estudio, examinamos cómo los monos aprenden a tomar decisiones que maximizan recompensas en líquido a través del refuerzo con fichas. La pregunta que se aborda aquí es cómo el valor de un estado, que es una función de múltiples características de la tarea (por ejemplo, el número actual de fichas acumuladas, opciones de elección, época de la tarea, ensayos desde la última entrega de refuerzo primario, etc.), impulsa el valor y afecta la motivación. Construimos un modelo de proceso de decisión de Markov que calcula el valor de los estados de la tarea dado las características de la tarea para luego correlacionarlo con el estado motivacional del animal. Los tiempos de fijación, los tiempos de reacción en las elecciones y la frecuencia de abortos estaban todos significativamente relacionados con los valores de los estados de la tarea durante la tarea de fichas (n = 5 monos, tres machos y dos hembras). Además, el modelo hace predicciones sobre cómo las respuestas neuronales podrían cambiar en un momento a otro en relación con los cambios en el valor del estado. Juntas, esta tarea y modelo nos permiten capturar el aprendizaje y el comportamiento relacionado con el refuerzo simbólico.
Burk et al. (Fri,) estudiaron esta cuestión.