Key points are not available for this paper at this time.
おべっかは、モデルが人間ユーザーの見解に従って応答を調整するという望ましくない行動であり、その見解が客観的に正しくない場合にも当てはまります(例:ユーザーがリベラルであることを明らかにした場合にリベラルな見解に適応する)。本論文では、言語モデルにおけるおべっかの蔓延を研究し、この行動を減少させるためのシンプルな合成データ介入を提案します。まず、正解がない文に対する意見をモデルに求める3つのおべっかタスク(Perez et al., 2022)において、モデルのスケーリングと指示調整がPaLMモデルの540Bパラメータまでの範囲でおべっかを有意に増加させることを観察しました。次に、客観的に間違っている単純な加算文に対するおべっかの評価を拡張し、これらの文が間違っていることを知っていても、ユーザーが同意すれば言語モデルが依然として同意することを発見しました。おべっかを減少させるために、公開されたNLPタスクを利用し、モデルにこれらのタスクに対するユーザーの意見に対して堅牢であることを促進するシンプルな合成データ介入を提示します。これらのデータを軽量なファインチューニングステップで追加することで、保持されたプロンプトに対するおべっか行動を有意に減少させることができます。介入用の合成データを生成するためのコードは、https://github.com/google/sycophancy-interventionで見つけることができます。
Wei et al. (Mon,) はこの問題を研究しました。