大型语言模型(LLMs)在各种自然语言处理任务中表现出色,包括西方医学领域。然而,针对 LLMs 的专业评估基准尚未涵盖传统中医学(TCM)领域,尽管该领域历史悠久、影响深远。为填补这一研究空白,我们推出了 TCM-Bench,这是一个用于评估 LLM 在中医领域表现的综合基准。它包含了 TCM-ED 数据集,包括 5,473 个来自中医执业医师考试(TCMLE)的问题,其中 1,300 个问题有权威分析。它涵盖了 TCMLE 的核心组成部分,包括中医基础和临床实践。为了超越准确性评估 LLM 的问答能力,我们提出了 TCMScore,这是一个专为评估 LLM 生成的中医相关问题答案质量而设计的指标。它全面考虑了中医语义和知识的一致性。通过从不同角度进行全面的实验分析,我们可以得出以下发现: (1) LLMs 在该基准上的不满意表现凸显了它们在中医领域的显著改进空间。 (2) 引入领域知识可以提升 LLMs 的表现。然而,对于像 ZhongJing-TCM 这样的领域特定模型,生成分析文本的质量有所下降,我们假设它们的微调过程影响了基本 LLM 能力。 (3) 传统的文本生成质量评估指标如 Rouge 和 BertScore 易受文本长度和表面语义模糊的影响,而领域特定指标如 TCMScore 可以进一步补充和解释它们的评估结果。这些发现突显了 LLM 在中医领域的能力和局限性,旨在为医学研究提供更深刻的支持。
Yue 等人(Mon,)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: