Key points are not available for this paper at this time.
自动摘要评估对于机器生成和人类制作的摘要都很有用。自动评估给定文档的摘要文本例如可以用于摘要生成系统的开发和不当摘要的检测。摘要评估可以以多种模式进行:对摘要生成系统进行排序;排序特定文档的摘要;以及在绝对尺度上评估文档-摘要配对的质量。现有的摘要评估标注数据集通常基于新闻摘要数据集,如CNN/DailyMail或XSum。在这项工作中,我们描述了一个新的数据集,即播客摘要评估语料库,这是一个由人类专家在TREC2020评估的播客摘要集合。与现有的摘要评估数据相比,该数据集有两个独特的方面:(i)基于长输入的语音播客文档;和(ii)在播客语料库中检测不当参考摘要的机会。首先,我们检查现有的评估方法,包括无模型和基于模型的方法,并为该长输入摘要评估数据集提供基准结果。其次,旨在过滤用于训练的参考摘要-文档配对,我们应用摘要评估进行数据选择。这两个方面的实验结果为摘要评估和生成任务提供了有趣的见解。播客摘要评估数据集是可用的。
Manakul等(Sun,)研究了这个问题。