Key points are not available for this paper at this time.
将大量的非结构化文本提炼成结构化的、简洁的形式,如表格,是一个开放的研究问题。自动生成表格的主要挑战之一是确保其语法有效性。先前的方法通过在变换器的注意机制中包含额外参数来解决这一挑战,以关注特定的行和列标题。与这种单阶段方法相比,本文提出了一种称为生成表(gTBLS)的双阶段方法。第一阶段从文本中推断表结构(行和列标题)。第二阶段使用这些标题 formulates 问题,并微调因果语言模型以回答这些问题。此外,gTBLS 方法适合在零样本配置中利用预训练的大型语言模型,为在无法进行微调的情况下的表生成提供了解决方案。在表构建任务上,gTBLS 在 BERTScore 上提高了多达 10%,在 E2E、WikiTableText、WikiBio 和 RotoWire 数据集的表内容生成任务上提高了多达 20%。
Sundar 等(周四)研究了这个问题。