Key points are not available for this paper at this time.
背景:大型语言模型(LLMs),如ChatGPT(Open AI),在医学中越来越多地被使用,并作为信息来源补充标准搜索引擎。这导致更多人"咨询"LLMs关于个人医疗症状。目的:本研究旨在评估ChatGPT在耳鼻喉科(ORL)回答临床案例问题的表现,并与ORL咨询师的答案进行比较。方法:我们使用了来自已建立的ORL学习书籍和德国医师国家考试的41个案例问题。问题由ORL咨询师和ChatGPT 3回答。ORL咨询师使用6分制李克特量表对除他们自己的所有回答进行医学适宜性、简洁性、连贯性和可理解性的评价。他们还在盲法设置下确定答案是由ORL咨询师还是ChatGPT创作。此外,还比较了字符数。由于技术迅速发展的步伐,比较了ChatGPT 3和ChatGPT 4生成的回答,以了解LLMs的发展潜力。结果:在所有类别中,ORL咨询师的评分显著较高(P<.001)。尽管低于ORL咨询师的得分,ChatGPT在语义类别(简洁性、连贯性和可理解性)中的得分相对较高,与医学适宜性相比。ORL咨询师在98.4%(121/123)的案例中正确识别ChatGPT为来源。与ORL咨询师相比,ChatGPT的回答字符数显著更高(P<.001)。ChatGPT 3和ChatGPT 4生成的回答之间的比较显示医学准确性有轻微改善,同时提供的答案的连贯性更好。相反,尽管字符平均数显著增加了52.5%(n= (1470-964)/964; P<.001),但简洁性(P=.06)和可理解性(P=.08)并没有显著改善。结论:虽然ChatGPT对医学问题提供了更长的回答,但与ORL咨询师的答案相比,医学适宜性和简洁性显著较低。LLMs作为医疗护理的辅助工具具有潜力,但它们对医疗问题的"咨询"存在较高的错误信息风险,因为它们高语义质量可能掩盖上下文缺陷。
Buhr等人(星期二)研究了这个问题。