Key points are not available for this paper at this time.
A avaliação automática de resumos é útil tanto para resumos gerados por máquinas quanto para resumos produzidos por humanos. Avaliar automaticamente o texto do resumo dado o documento permite, por exemplo, o desenvolvimento de sistemas de geração de resumos e a detecção de resumos inadequados. A avaliação de resumos pode ser realizada em vários modos: classificando sistemas de geração de resumos; classificando resumos de um determinado documento; e estimando a qualidade de um par documento-resumo em uma escala absoluta. Conjuntos de dados existentes com anotação para avaliação de resumos geralmente são baseados em conjuntos de dados de sumarização de notícias, como CNN/DailyMail ou XSum. Neste trabalho, descrevemos um novo conjunto de dados, o corpus de avaliação de resumo de podcast, uma coleção de resumos de podcasts que foram avaliados por especialistas humanos no TREC2020. Comparado aos dados existentes de avaliação de resumos, este conjunto de dados possui dois aspectos únicos: (i) documentos baseados em podcasts, com entrada longa e em formato de discurso; e (ii) uma oportunidade para detectar resumos de referência inadequados no corpus de podcast. Primeiramente, examinamos métodos de avaliação existentes, incluindo métodos livres de modelo e baseados em modelo, e fornecemos resultados de referência para este conjunto de dados de avaliação de resumo de entrada longa. Em segundo lugar, com o objetivo de filtrar o pareamento de referência de resumo-documento para treinamento, aplicamos a avaliação de resumos para seleção de dados. Os resultados experimentais sobre esses dois aspectos fornecem insights interessantes sobre as tarefas de avaliação e geração de resumos. Os dados de avaliação de resumo de podcast estão disponíveis.
Manakul et al. (Sun,) estudaram esta questão.