Key points are not available for this paper at this time.
Modelos de linguagem de grande porte (LLMs) encontram cada vez mais seu lugar nas mais diversas áreas de nossas vidas cotidianas. Eles influenciam indiretamente as decisões ou opiniões das pessoas por meio de seu uso diário. Portanto, compreender como e quais julgamentos morais esses LLMs fazem é crucial. No entanto, a moralidade não é universal e depende do contexto cultural. Isso levanta a questão de se essas preferências culturais também se refletem nos LLMs quando solicitados em diferentes idiomas ou se a tomada de decisão moral é consistente em diferentes línguas. Até agora, a maioria das pesquisas se concentrou em investigar os valores inerentes dos LLMs em inglês. Embora alguns trabalhos realizem análises multilíngues de viés moral em LLMs em um ambiente multilíngue, essas análises não vão além de ações atômicas. Até onde sabemos, uma análise multilíngue de viés moral em dilemas ainda não foi realizada. Para abordar isso, nosso artigo se baseia no experimento da máquina moral (MME) para investigar as preferências morais de cinco LLMs, Falcon, Gemini, Llama, GPT e MPT, em um ambiente multilíngue e as compara com as preferências coletadas de humanos pertencentes a diferentes culturas. Para conseguir isso, geramos 6500 cenários do MME e solicitamos aos modelos em dez idiomas qual ação tomar. Nossa análise revela que todos os LLMs inibem diferentes vieses morais em certo grau e que não só diferem das preferências humanas, mas também entre várias línguas dentro dos próprios modelos. Além disso, encontramos que quase todos os modelos, particularmente o Llama 3, desviam muito dos valores humanos e, por exemplo, preferem salvar menos pessoas em vez de salvar mais.
Vida et al. (Sun,) estudaram essa questão.