Key points are not available for this paper at this time.
背景:确定纳入系统评价相关研究(即筛查)是一项复杂、繁重且昂贵的任务。最近,许多研究表明,使用机器学习和文本挖掘方法自动识别相关研究有可能大幅减少筛查阶段的工作量。这些机器学习方法绝大多数都利用相同的基本原理,即将研究建模为词袋(BOW)。方法:我们探讨了使用主题建模方法以获得更具信息性的研究表示。我们应用潜在狄利克雷分配(LDA),一种无监督的主题建模方法,自动识别一组研究中的主题。然后,我们将每项研究表示为LDA主题的分布。此外,我们通过使用自动术语识别(ATR)工具识别的多词术语来丰富使用LDA获得的主题。为了评估,我们使用基于支持向量机(SVM)的分类器自动识别相关研究,该分类器同时利用我们新颖的基于主题的表示和BOW表示。结果:我们的结果显示,SVM分类器在使用LDA表示时能够识别出更多的相关研究,而不是使用BOW表示。这些观察结果适用于两个临床领域的系统评价和三个社会科学领域的评价。结论:在自动引用筛查任务中,与BOW表示相比,文档的基于主题的特征表示表现更佳。提议的丰富术语主题更具信息性且对系统评价者来说不那么模糊.
Mo等人(星期四)研究了这个问题。