文献综述表对于总结和比较科学论文的集合至关重要。我们探讨生成满足用户信息需求的表格的任务,给定一组科学论文。在近期的工作(Newman et al., 2024)的基础上,我们扩展了以前的方法,通过结合基于大型语言模型的方法和人工注释来解决现实世界的复杂性。我们的贡献集中在实际使用中遇到的三个关键挑战上:(i)用户提示通常缺乏明确性;(ii)检索到的候选论文常常含有无关内容;以及(iii)任务评估应超越肤浅的文本相似性技术,而应评估推断表格在信息检索任务中的效用(例如,比较论文)。为了支持可重复的评估,我们引入了ARXIV2TABLE,这是这个任务一个更现实和具有挑战性的基准,以及一种新的方法来改善现实场景中的文献综述表生成。我们在这个基准上的广泛实验表明,无论是开放权重还是专有的语言模型在这个任务中都面临困难,突显了任务的难度与进一步改进的必要性。我们的数据集和代码可在https://github.com/JHU-CLSP/arXiv2Table获取。
Wang等人(Mon,)研究了这个问题。