Los puntos clave no están disponibles para este artículo en este momento.
Mientras que el Aprendizaje por Refuerzo Profundo (DRL) ha surgido como una solución prometedora para tareas de control complejas, la falta de explicabilidad de las políticas aprendidas impide su adopción en aplicaciones críticas para la seguridad, como los sistemas de conducción automatizada (ADS). Las explicaciones contrafactuales (CF) han ganado prominencia recientemente por su capacidad para interpretar modelos de Deep Learning (DL) de caja negra. Los ejemplos CF están asociados con cambios mínimos en la entrada, resultando en una salida complementaria por parte del modelo DL. Encontrar tales alteraciones, particularmente para entradas visuales de alta dimensión, plantea desafíos significativos. Además, la dependencia temporal introducida por la acción del agente DRL basada en un historial de observaciones de estados pasados complica aún más la generación de ejemplos CF. Para abordar estos desafíos, proponemos usar un mapa de saliencia para identificar los píxeles de entrada más influyentes a lo largo de la secuencia de estados observados por el agente. Luego, alimentamos este mapa a un modelo generativo profundo, permitiendo la generación de CF plausibles con modificaciones restringidas centradas en las regiones salientes. Evaluamos la efectividad de nuestro marco en diversos dominios, incluidos ADS, Atari Pong, Pacman y juegos de space-invaders, utilizando métricas de rendimiento tradicionales como validez, proximidad y escasez. Los resultados experimentales demuestran que este marco genera CF más informativos y plausibles que el estado del arte para una amplia gama de entornos y agentes DRL. Con el fin de fomentar la investigación en esta área, hemos puesto nuestros conjuntos de datos y códigos a disposición del público en https://github.com/Amir-Samadi/SAFE-RL.
Samadi et al. (Sun,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: