Key points are not available for this paper at this time.
在工程背景下,自然语言处理技术在信息检索、索引、主题建模和文本分类方面的应用日益增加。这类任务的标准组成部分是删除停用词,即数据中无信息量的成分。尽管研究人员使用可从非技术资源中获得的现成停用词列表,但工程领域的技术术语包含它们自己高度频繁和无信息量的词汇,且没有针对技术语言处理应用的标准停用词列表。在这里,我们通过严格识别在工程文本中超出一般文本的停用词的通用、微不足道和无信息量的停用词来填补这一空白,基于替代统计量的合成,如词频、逆文档频率和熵,并策划一个适合技术语言处理应用的停用词数据集.
Sarica et al. (Thu,) 研究了这一问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: