Key points are not available for this paper at this time.
Seguindo o rápido progresso nos modelos de processamento de linguagem natural (PLN), modelos de linguagem são aplicados a tarefas interativas cada vez mais complexas, como negociações e moderação de conversas. Ter avaliadores humanos interagindo diretamente com esses modelos de PLN é essencial para avaliar adequadamente o desempenho em tais tarefas interativas. Desenvolvemos o BotEval, uma ferramenta de avaliação de código aberto, facilmente personalizável, que se concentra em permitir interações humano-bot como parte do processo de avaliação, em vez de avaliadores humanos fazerem julgamentos sobre uma entrada estática. O BotEval equilibra flexibilidade para personalização e facilidade de uso, fornecendo modelos para casos de uso comuns que abrangem vários níveis de complexidade e compatibilidade embutida com plataformas populares de crowdsourcing. Apresentamos os inúmeros recursos úteis do BotEval por meio de um estudo que avalia o desempenho de vários chatbots em sua eficácia para moderação de conversas e discutimos como o BotEval difere de outras ferramentas de anotação.
Cho et al. (Qui,) estudaram essa questão.