Key points are not available for this paper at this time.
最近的研究表明,预训练语言模型(PTLMs)(如 BERT)具备一定的常识和事实知识。研究指出,通过预测掩码词将 PTLMs 用作“神经知识库”很有前景。令人惊讶的是,我们发现这可能不适用于数值常识知识(例如,鸟通常有两条腿)。在本文中,我们探讨了是否以及在多大程度上可以从 PTLMs 中诱导数值常识知识,并研究了该过程的稳健性。为了对此展开研究,我们引入了一项带有诊断数据集 NumerSense 的新型探针任务,其中包含 13.6k 个掩码词预测探针(10.5k 用于微调,3.1k 用于测试)。我们的分析显示:(1) 在进行任何微调之前,BERT 及其更强的变体 RoBERTa 在诊断数据集上的表现均较差;(2) 利用远程监督进行微调带来了一定改进;(3) 与人类表现相比,表现最好的监督模型依然较差(准确率为 54.06% vs 96.3%)。
Lin et al. (Sat,) 研究了这一问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: