Key points are not available for this paper at this time.
引言:关于ChatGPT(OpenAI,San Francisco,CA)回答解剖学问题的潜能及其在解剖学教育中发挥重要作用的潜力,目前尚存争议。本研究旨在评估ChatGPT检索并总结关于其自身回答解剖学问题表现的相关文献的能力。我们还旨在探讨Gemini(Google,Mountain View,CA)执行该任务的能力。方法:我们要求ChatGPT和Gemini列出并总结五项研究:1)关于ChatGPT回答解剖学问题的能力;2)在回答解剖学问题方面将ChatGPT与另一种人工智能(AI)工具进行比较;3)表明ChatGPT回答解剖学问题的正确率低于70%。对于每个查询,我们衡量了有多少项研究被 1)正确识别以及 2)准确总结,并评估了是否存在任何偏倚。结果:ChatGPT在第一个查询中表现优异(100%/100%),在第二个查询中表现较差(20%/20%),在第三个查询中表现中等(60%/40%)。它进行了严格的自我评估,且未出现幻觉。Gemini在三个查询中的表现分别为100%/40%、60%/40%和80%/60%。它在查找不同类型出版物时不够灵活,且经常产生幻觉并表现出对ChatGPT的偏见。结论:仅当仅被要求检索关于ChatGPT回答解剖学问题能力的研究时,ChatGPT和Gemini才能生成可靠的回答。它们在检索和概述对比性研究方面尤其困难。尽管Gemini总体表现较好,但它会产生幻觉并对ChatGPT表现出偏见。持续的技术演进可能会增强ChatGPT和Gemini为解剖学研究做出贡献的潜力。
Chytas et al. (Wed,) 对该问题进行了研究。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: