본 연구는 대형 언어 모델(LLM)이 고차원 마음 이론(ToM) 즉, 여러 정신 및 감정 상태를 재귀적으로 추론하는 인간의 능력을 얼마나 발전시켰는지를 조사합니다(예: 나는 네가 그녀가 알고 있다고 믿는다고 생각합니다). 본 논문은 손으로 작성된 테스트 모음인 '다중 차원 마음 이론 Q&A'를 도입하여 5개의 LLM의 성과를 새롭게 수집한 성인 인간 기준과 비교합니다. 우리는 GPT-4와 Flan-PaLM이 전체적으로 ToM 작업에서 성인 수준 및 근접 성인 수준의 성과에 도달했으며, GPT-4가 6차 추론에서 성인 성과를 초과한다는 사실을 발견했습니다. 우리의 결과는 모델 크기와 미세 조정 간의 상호작용이 ToM 능력 실현에 중요함을 시사하며, 최상의 성과를 내는 LLM들이 ToM에 대한 일반화된 능력을 개발했음을 나타냅니다. 고차원 ToM이 다양한 협력적이고 경쟁적인 인간 행동에서 중요한 역할을 한다는 점에서, 이 발견은 사용자 지향 LLM 응용 프로그램에 중대한 의미를 갖습니다.
Street et al. (수요일)은 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: