A aprendizagem de meta-reforço offline (OMRL) permite de forma proficiente que um agente enfrente tarefas novas enquanto confia exclusivamente em um conjunto de dados estático. Para a identificação precisa e eficiente de tarefas, a pesquisa existente em OMRL sugere aprender representações de tarefas separadas que podem ser incorporadas à entrada da política, formando assim uma meta-política baseada em contexto. Uma abordagem principal para treinar representações de tarefas é adotar a aprendizagem contrastiva usando dados offline de múltiplas tarefas. O conjunto de dados normalmente abrange interações de várias políticas (ou seja, as políticas de comportamento), proporcionando assim uma porção considerável de informações contextuais sobre diferentes tarefas. No entanto, acumular dados de um número substancial de políticas não é apenas impraticável, mas também frequentemente inatingível em ambientes realistas. Em vez disso, recorremos a um cenário mais restrito, mas prático, onde a coleta de dados de múltiplas tarefas ocorre com um número limitado de políticas. Observamos que as representações de tarefas aprendidas a partir de métodos OMRL anteriores tendem a correlacionar-se espúriamente com a política de comportamento, ao invés de refletir as características essenciais da tarefa, resultando em uma generalização desfavorável fora da distribuição. Para aliviar essa questão, introduzimos um novo algoritmo para desvincular o impacto da política de comportamento do aprendizado de representação de tarefas por meio de um processo chamado aumento de dados adversariais. Especificamente, o objetivo do aumento de dados adversariais não é meramente gerar dados análogos à distribuição de dados offline; em vez disso, visa criar exemplos adversariais projetados para confundir as representações de tarefas aprendidas e levar à identificação incorreta da tarefa. Nossos experimentos mostram que aprender com tais amostras adversariais melhora significativamente a robustez e a eficácia do processo de identificação de tarefas e alcança uma generalização satisfatória fora da distribuição.
Jia et al. (Mon,) estudaram essa questão.