Key points are not available for this paper at this time.
大型语言模型(LLMs)在问题超出其内部知识边界时被发现会产生幻觉。一个可靠的模型应该清晰地认知其知识边界,在其范围内提供正确答案,并在缺乏知识时拒绝回答。现有研究通常使用生成标记的概率或言语信心来衡量LLMs对其知识边界的认知。然而,这些研究忽视了二者之间的差异和联系。本文对LLMs的概率认知和言语认知进行全面分析与比较。首先,我们探讨这两种认知的优缺点。然后,我们研究它们在不同频率问题下的变化。最后,我们测量LLMs的概率信心与言语信心之间的相关性。实验结果表明:1)LLMs的概率认知通常比言语认知更准确,但需要领域内的验证集来调整信心阈值。2)两种认知在较少频率的问题上表现更好。3)LLMs准确地用自然语言表达其内部信心是具有挑战性的.
Ni等人(Mon,)研究了这个问题。