公众对甲状腺眼病(TED)认知的匮乏通常会导致就医延误。尽管大语言模型(LLM)在加强患者教育方面具有巨大潜力,但其回答 TED 相关问题的能力尚未得到全面评估。本研究旨在评估 LLM 解答 TED 相关问题的能力,并探索针对特定疾病领域定制 LLM 的可行性。考虑到候选 LLM 的多样性,我们部署了级联流程来寻找最适合 TED 的模型。我们首先评估了几种主流 LLM 在选择题上的表现。选择表现最佳的模型 GPT-4 和 Claude 3.5 进行定制,创建了 TED-GPT 和 TED-Claude。随后应用思维链(CoT),生成了 CoT-GPT 和 CoT-Claude。我们还评估了具有原生 CoT 能力的较新 LLM(GPT-4-o1、GPT-4-o3、Gemini-2.0-Flash、Gemini-2.5-Pro、Claude 3.7)。随后在选择题上对这些模型及其原始版本进行了评估和比较。在简答题和病例题上对表现更佳的 TED-GPT 和 TED-Claude 进行了评估,并使用 QUEST 框架(质量、理解/推理、表达、安全性/危害、信任)将其与原始版本进行比较。对于选择题,GPT-4 和 Claude 3.5 取得了具有竞争力的准确率(分别为 76.2% 和 83.2%)。加入 CoT 以及对 GPT-4 和 Claude 3.5 进行定制后,准确率有所提高(CoT-GPT 86.1%、CoT-Claude 87.1%、TED-GPT 86.1%、TED-Claude 89.1%),优于所有其他较新的 LLM。对于病例题和简答题,定制的 TED-GPT 和 TED-Claude 的表现也优于其原始版本。TED-Claude 在准确性、可读性、全面性、危害可能性和推理能力方面表现最佳。因此,LLM(尤其是 TED-Claude)在回答 TED 相关问题方面取得了较为满意的表现。此外,使用 LLM 的定制模块并结合 CoT 有效提升了模型性能。这表明临床医生可以使用这些简单且通用的方法来构建适用于特定医学领域的 LLM。
Lei et al. (Sat,) 对这一问题进行了研究。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: