Key points are not available for this paper at this time.
大型语言模型(LLMs)在文本生成和理解方面表现出强大的能力,模仿人类行为并展现合成人格。然而,一些LLMs展示了攻击性人格,传播有害言论。现有文献忽视了LLM人格的起源和演变,以及有效的人格控制。为了填补这些空白,我们的研究展开了对LLM人格控制的全面调查。我们研究了几种影响LLMs的典型方法,包括三种训练方法:持续预训练、监督微调(SFT)和人类反馈强化学习(RLHF),以及推理阶段的考虑(提示)。我们的调查揭示了控制效果的等级:提示 > SFT > RLHF > 持续预训练。值得注意的是,SFT的控制成功率高于提示诱导。尽管提示证明了其高效性,但我们发现提示诱导的人格不如经过训练的人格稳健,更容易在反向人格提示诱导下表现出冲突的人格。此外,结合SFT和提示的优点,我们提出了监督微调后的提示诱导(PISF),它成为控制LLM人格的最有效和稳健的策略,展现出高效性、高成功率和高稳健性。即使在反向人格提示诱导下,经过PISF控制的LLMs仍能展现稳定和稳健的人格。
Chen等人(周四)研究了这个问题。