Key points are not available for this paper at this time.
语言和文化之间复杂的关系长期以来一直是语言人类学领域探索的主题。作为集体人类知识仓库的大型语言模型(LLMs)提出了一个重要问题:这些模型是否真正涵盖了不同文化所采用的多样知识?我们的研究表明,这些模型在两个维度上表现出更强的文化对齐——首先,当以特定文化的主导语言提示时;其次,当用该文化所使用的精炼语言混合进行预训练时。我们通过模拟社会调查量化文化对齐,将模型的响应与实际调查参与者的响应进行比较作为参考。具体而言,我们通过在阿拉伯语和英语中使用不同的预训练数据混合,模拟在埃及和美国各地区进行的调查,并使用真实响应者的人物角色和调查问题。进一步分析表明,对于代表性不足的人物角色和文化敏感话题(如探讨社会价值观的议题),错配现象变得更加明显。最后,我们引入了人类学提示,这是一种利用人类学推理来增强文化对齐的新方法。我们的研究强调了需要一个更平衡的多语言预训练数据集,以更好地代表人类经验的多样性和不同文化的多元性,这对跨语言转移主题有许多重要影响。
AlKhamissi等人(Mon,)研究了这个问题。