Key points are not available for this paper at this time.
Consideramos o problema de aprender a melhor política possível a partir de um conjunto de dados fixo, conhecido como Aprendizado por Reforço Offline (RL). Uma taxonomia comum dos trabalhos existentes em RL offline é a regularização de política, que geralmente restringe a política aprendida pela distribuição ou suporte da política de comportamento. No entanto, as restrições de distribuição e suporte são excessivamente conservadoras, uma vez que ambas forçam a política a escolher ações semelhantes à política de comportamento ao considerar estados particulares. Isso limitará o desempenho da política aprendida, especialmente quando a política de comportamento é sub-ótima. Neste artigo, descobrimos que regularizar a política em direção ao par estado-ação mais próximo pode ser mais eficaz e, assim, propomos a Regularização de Política com Restrição de Conjunto de Dados (PRDC). Ao atualizar a política em um estado determinado, a PRDC pesquisa todo o conjunto de dados em busca da amostra estado-ação mais próxima e, em seguida, restringe a política com a ação dessa amostra. Ao contrário dos trabalhos anteriores, a PRDC pode guiar a política com comportamentos apropriados do conjunto de dados, permitindo que escolha ações que não aparecem no conjunto de dados junto com o estado dado. É uma restrição mais suave, mas ainda mantém um conservadorismo suficiente em relação a ações fora da distribuição. Evidências empíricas e análises teóricas mostram que a PRDC pode aliviar a fundamentalmente desafiadora questão da superestimação do valor do RL offline com uma lacuna de desempenho limitada. Além disso, em um conjunto de tarefas de locomoção e navegação, a PRDC atinge desempenho de ponta em comparação com métodos existentes. O código está disponível em https://github.com/LAMDA-RL/PRDC
Ran et al. (Sun,) estudaram essa questão.