背景:大型语言模型(LLMs)在医学教育中的应用越来越广泛,但在儿科等专业领域的表现仍未得到充分研究。目的:评估并比较四种主要LLMs在标准儿科多项选择题(MCQs)上的表现,并将结果与医学生的表现进行基准比较。方法:我们评估了四种主要的LLMs:Copilot(微软)、Claude(Anthropic)、ChatGPT(OpenAI)和Gemini(谷歌),这些模型在六个儿科主题的120道MCQs上进行测试:肺病学、发育疾病、传染病、普通儿科、新生儿学和肾脏学。每个LLM进行了三次问题尝试以评估一致性。医学生在相同题目上的表现作为基准,而随机回答提供了基线控制。结果:LLMs的平均准确率为80.4±10.9%,比医学生(72.1±13.1%)高出8.3%,并且超出随机回答(20.5±6.2%)近四倍。Copilot(84.5±8.3%)和Claude(84.2±9.9%)的准确率最高,其次是GPT-4o(80.9±9.1%)和Gemini(72.0±18.9%)。在所有LLM与学生的比较中,只有GPT-4o显示出准确率的统计显著性差异(χ²=4.277,p=0.039),其表现比学生高8.8%。LLMs在肺病学(96.3%)、发育疾病(86.3%)和传染病(85%)中表现出色,但在肾脏学(67.5%)和新生儿学(69.7%)中表现较差。所有LLM在所有尝试中仅有50%(60/120)的题目被全部答对,6.7%(8/120)的题目从未答对。结论:现代LLMs在儿科知识方面表现出色,通常超越医学生的表现,但在各个主题上的一致性有所不同。这些发现表明,LLMs可能在医学教育中充当有价值的辅助工具,同时强调在肾脏学和新生儿学等专业医学领域中进一步改进的必要性。关键词:人工智能,医学教育,儿科,大型语言模型,多项选择题
Bolgova等(周五)研究了这个问题。