Key points are not available for this paper at this time.
倫理的推論は、大規模言語モデル(LLM)の重要なスキルです。しかし、道徳的価値は普遍的ではなく、言語や文化に影響されます。本論文では、3つの著名なLLMであるGPT-4、ChatGPT、およびLlama2-70B-Chatが異なる言語でどのように倫理的推論を行い、彼らの道徳的判断が促された言語に依存するかを探求します。私たちは、Rao et al.(2023)の倫理的推論に関する研究を拡張し、義務論、美徳主義、帰結主義の3つの規範倫理の分野からの倫理的ジレンマと政策を持ってLLMをテストする彼らのフレームワークに従って、多言語設定に適用します。英語、スペイン語、ロシア語、中国語、ヒンディー語、スワヒリ語の6つの言語で実験します。GPT-4は、言語を超えて最も一貫して偏りのない倫理的推論者である一方、ChatGPTおよびLlama2-70B-Chatは、英語以外の言語に移ると顕著な道徳的価値の偏りを示します。興味深いことに、この偏りの性質は、GPT-4を含むすべてのLLMで言語ごとに大きく異なります。
Agarwal et al.(Mon,)はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: