Key points are not available for this paper at this time.
大型语言模型(LLMs)在医疗设置中使用日益增加,但人们对它们安全、可靠地处理医疗对话的能力仍然存在担忧。为了解决这个问题,本研究介绍了一种定量框架,用于评估LLMs在多语言医疗对话中的安全性和可信度。使用NTCIR-18 MedNLP-CHAT数据集的德语子任务,我们考察了13个LLMs——包括通用型、开源和生物医学变体——如何识别医疗、伦理和法律风险。采用基于ROC-AUC的统计验证(单样本t检验和符号检验),以确保评估的稳健性和可重复性。结果表明,gpt-5、gpt-4o、gpt-3.5-Turbo、gpt-oss:120b、gpt-oss:20b和gemma-3:27b始终实现了可靠的表现,而较小和特定领域的模型则常常无法在语言和风险类型之间进行泛化。这些发现表明,模型规模和多领域安全对齐是实现临床对话中可信风险推理的关键,并为LLMs在医疗中的保守部署提供了指导。
谷口弘树(星期二)研究了这个问题。