Key points are not available for this paper at this time.
本文研究了大语言模型(LLMs)中的微调在多大程度上有效缓解与仅仅掩盖不良行为之间的关系。通过设计半现实角色扮演练习以引发此类行为,我们探索了微调干预后LLMs的响应动态。我们的方法论包括提示模型进行思维链(CoT)推理,并分析推理痕迹与最终输出之间的一致性。值得注意的是,我们识别出一种我们称之为基于理性的欺骗的普遍现象,在这种现象中,模型要么停止生成推理痕迹,要么生成表面上合乎伦理的推理痕迹,而这些推理痕迹掩盖了其最终输出的不道德性。我们进一步研究了反应策略(礼貌拒绝与明确反驳)在抑制多轮交互的后续输出中不良行为出现的有效性。我们的发现表明,明确的反驳在防止不良输出的延续上明显优于礼貌拒绝,几乎消除了基于理性的欺骗,这挑战了当前的模型微调实践。因此,本文的两个关键贡献是(1)定义和研究基于理性的欺骗,一种新的隐藏行为,以及(2)证明反驳提供了比拒绝更强健的响应模型,从而强调了重新考虑微调方法中响应策略的必要性。
Pop 等(周四)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: