背景:生成性人工智能(GenAI)模型因其易获取性和高效性,越来越多地用于医学信息检索。然而,这些模型的响应准确性和可读性,特别是针对上消化道癌症,尚未得到充分评估。这一缺口凸显了进行严格评估的必要性,以确保可靠的患者教育和临床整合。目的:本研究旨在评估四个主要GenAI模型(Kimi、DeepSeek、ChatGPT和Gemini)在处理与食管和胃癌相关的以患者为中心的问题时生成响应的准确性和可读性。方法:向每个模型提出了25个标准化的与食管和胃癌相关的医学问题,涵盖了疾病定义、治疗和管理等领域。由四位肿瘤学家使用5分制李克特量表评估响应的准确性,并使用Flesch–Kincaid阅读容易度、Flesch–Kincaid年级水平和SMOG指标分析可读性。通过问卷确定患者感兴趣的高价值问题。结果:在比较GenAI生成响应的准确性时,DeepSeek获得了最高的总体准确性得分,并在定义和治疗问题中优于其他模型,而ChatGPT在管理相关问题中表现出色。在子组分析中,GenAI模型在回答患者更偏好询问的定义和管理问题时展现了更高的准确性,相比之下在癌症治疗问题上的准确性较低。所有模型生成的响应要求阅读能力达到11年级到大学水平。结论:本研究揭示,在此比较评估GenAI模型的应用中,DeepSeek为上消化道癌症定义和治疗的问题提供了最准确的响应,而ChatGPT在管理相关问题中显现出优势。然而,所有模型生成的文本都要求较高级别的阅读能力,这突显了在不影响准确性的情况下优化可读性的重要性。GenAI在患者教育方面展现出前景,但需要严格验证以便于临床整合。
Ran等(Mon,)研究了这个问题。