Key points are not available for this paper at this time.
摘要 目的 本研究评估大型语言模型(LLMs)——ChatGPT-4.0和Perplexity Pro——生成准确、简明的标志性外科研究摘要用于外科住院医生教育的能力。 方法 来自四个亚专科的外科主治医师选择了各自领域内的标志性研究。我们要求ChatGPT-4.0和Perplexity Pro生成每项研究的一页摘要。使用盲评的方法,外科主治医师对摘要的准确性进行了评估,评估领域包括:背景、方法、纳入/排除标准、治疗组、关键发现和临床相关性。计算了精确度、召回率和F1分数。精确度衡量LLMs只包括真实信息的能力,而召回率衡量包括所有相关信息的能力。F1分数是精确度和召回率的综合,代表LLMs的整体表现。对住院医生进行了调查,以评估LLM生成的摘要的教育价值。 结果 ChatGPT-4.0的精确度为0.93,召回率为0.96,F1分数为0.95。Perplexity Pro的表现类似,精确度为0.96,召回率为0.94,F1分数为0.95。两个模型在报告纳入/排除标准时表现最差,其中ChatGPT-4.0的精确度为0.93,召回率为0.84,F1分数为0.89。Perplexity在这一领域的精确度为1.00,召回率为0.81,F1分数为0.90。两种模型的表现没有显著差异。所有接受调查的住院医生报告称这些摘要对他们的常规学习材料有帮助,并推荐LLM生成更多摘要。 结论 ChatGPT和Perplexity生成的AI摘要准确,并被外科住院医生视为具有教育价值。该方法为将关键外科文献整合入住院医生教育提供了一种高效工具.
Pettigrew等(周五)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: