大規模言語モデル(LLM)は医療アプリケーションの進歩において大きな可能性を示していますが、医療倫理の課題に対処する能力は十分に探求されていません。本論文では、医療倫理の分野におけるLLMを体系的に評価するために設計された新しいベンチマーク、MedEthicEvalを紹介します。私たちのフレームワークは、医療倫理の原則に対するモデルの理解を評価する「知識」と、多様なシナリオでこれらの原則を適用する能力に焦点を当てる「適用」の2つの主要なコンポーネントから成ります。このベンチマークを支えるために、私たちは医療倫理の研究者と相談し、明らかな倫理的課題に対処する3つのデータセットを開発しました: 医療倫理の明白な侵害、明確な傾向を持つ優先順位ジレンマ、明白な解決策がない均衡ジレンマです。MedEthicEvalは、医療におけるLLMの倫理的推論を理解するための重要なツールであり、医療コンテキストにおける責任ある効果的な使用への道を切り開きます。
Jin et al. (2025) はこの問題を研究しました。