Key points are not available for this paper at this time.
O aprendizado por reforço explicável (XRL) é um subcampo emergente do aprendizado de máquina explicável que tem atraído considerável atenção nos últimos anos. O objetivo do XRL é elucidar o processo de tomada de decisão dos agentes de aprendizado por reforço (RL) em configurações de tomada de decisão sequencial. Equipados com essa informação, os praticantes podem entender melhor questões importantes sobre os agentes de RL (especialmente aqueles implantados no mundo real), como o que os agentes farão e por que. Apesar do aumento do interesse, existe uma lacuna na literatura para organizar a infinidade de artigos—especialmente de uma maneira que centralize a natureza da tomada de decisão sequencial do problema. Nesta pesquisa, propomos uma nova taxonomia para organizar a literatura de XRL que prioriza o ambiente de RL. Propomos três categorias de alto nível: importância de características, processo de aprendizado e processo de decisão de Markov, e nível de política. Revertemos as técnicas de acordo com essa taxonomia, destacando desafios e oportunidades para trabalhos futuros. Concluímos usando essas lacunas para motivar e delinear um roteiro para trabalhos futuros.
Milani et al. (Sat,) estudaram essa questão.