大規模言語モデル(LLM)がマルチエージェントおよび人間-AIシステムにますます統合される中で、自己コンテキストと会話パートナーの認識を理解することは、信頼性のあるパフォーマンスと安全性の強化に不可欠です。これまでの研究では、LLMが自己の操業段階や制約を認識する能力である状況認識が広範に調査されてきましたが、対話パートナーのアイデンティティや特性を特定し適応する補完的な能力は、ほとんど無視されてきました。本論文では、この後者の能力を対話者認識として公式化し、現代のLLMにおけるその出現の初の体系的評価を提示します。我々は、対話者推論を推論パターン、言語スタイル、および整合性の好みという3つの次元で検討し、LLMが同一ファミリーの仲間やGPTやClaudeなどの特定の著名なモデルファミリーを信頼性高く特定することを示します。その実用的意義を示すために、対話者認識がプロンプトの適応を通じてマルチLLMのコラボレーションを向上させ、新たな整合性および安全性の脆弱性、たとえば報酬ハッキング行動や脱獄の感受性を高める三つのケーススタディを開発しました。我々の発見は、LLMにおけるアイデンティティに敏感な行動の二重の約束と危険を強調し、対話者認識のさらなる理解とマルチエージェント展開における新たな安全策の必要性を強調します。我々のコードはオープンソースで提供されています: https://github.com/younwoochoi/InterlocutorAwarenessLLM。
Choi et al. (Sat,)がこの問題を研究しました。