摘要:医疗执照考试中有相当一部分评估关键社交技能,如沟通、伦理和专业素养,这些对于优质的病人护理至关重要。近年来,人工智能(AI)越来越多地融入医疗系统,引发了监管者、提供者和患者对AI处理复杂以人为中心的情境能力的担忧。之前的研究显示,像GPT-3.5和GPT-4这样的语言模型在美国医疗执照考试(USMLE)的社交技能问题上表现良好。然而,新的模型如GPT-4o,Gemini 1.5 Pro和o1也已被引入,其中后者旨在通过“思维链”推理模拟人类思维,这与其他模型提供即时答案不同。推理对大型语言模型在需要社交技能的情境中的能力影响尚不明确。在此,我们评估了五个大型语言模型:GPT-4,GPT-4o,Gemini 1.5 Pro和o1-preview及其完整版本o1;使用来自UWORLD题库的四十个USMLE风格的社交技能问题,覆盖多个类别:沟通。频繁更改答案,主要改为不正确的选项,导致其整体排名从第二下降到第四。其他模型,包括最终版本的o1,并未观察到这种现象,它保持了一致的高水平表现。这些发现以及之前的研究强调了大型语言模型在医疗环境中回答基于知识的社交技能问题的有效性,有时甚至超过了普通人类表现。随着大型语言模型的不断增长和复杂化,其表现预计会进一步改善。特别是,基于推理的模型的强大表现表明,这类架构在促进AI在社交导向任务中的角色方面有着重要的前景。这些结果展示了基于推理的大型语言模型在补充和增强临床培训、医学教育和患者护理方面的日益潜力。
Alohali等人(周五)研究了这个问题。