Key points are not available for this paper at this time.
警告:本文可能包含不适内容。大型语言模型(LLMs)在各种任务中取得了显著的性能,尤其是在涉及多模态数据(如语音)的任务中。然而,这些模型通常由于其训练数据的性质而表现出偏见。最近,更多的语言模型(SLLMs)相继出现,突显了迫切需要解决这些偏见。本研究引入了口语立体集,这是一个专门用于评估SLLMs中社会偏见的数据集。通过检查不同模型如何对来自不同人口群体的语音作出反应,我们旨在识别这些偏见。我们的实验揭示了关于它们的性能和偏见水平的重要见解。研究结果表明,尽管大多数模型展现出最小偏见,但一些模型仍然表现出轻微的刻板印象或反刻板印象的倾向。
Lin等(星期三)研究了这个问题。