Key points are not available for this paper at this time.
Gerenciadores de diálogo baseados em aprendizado de máquina são capazes de aprender comportamentos complexos para completar uma tarefa, mas não é simples estender suas capacidades para novos domínios. Investigamos a capacidade de diferentes políticas de lidar com comportamento de usuários não cooperativos e quão bem a experiência em completar uma tarefa (como reservas em restaurantes) pode ser reaplicada ao aprender uma nova (por exemplo, reservar um hotel). Introduzimos a Política de Diálogo de Embedding Recorrente (REDP), que incorpora ações do sistema e estados de diálogo no mesmo espaço vetorial. O REDP contém um componente de memória e um mecanismo de atenção baseado em uma Máquina de Turing Neural modificada, e supera significativamente um classificador LSTM de base nesta tarefa. Também mostramos que tanto nossa arquitetura quanto a de base solucionam a tarefa de diálogo bAbI, alcançando 100% de precisão nos testes.
Власов et al. (Quarta-feira,) estudaram essa questão.