Key points are not available for this paper at this time.
감정 지원 대화(ESC)는 인간의 스트레스를 줄이고, 정서적 안내를 제공하며, 궁극적으로 인간의 정신적 및 신체적 웰빙을 향상시키는 것을 목표로 하는 중요한 응용 프로그램입니다. 대형 언어 모델(LLMs)의 발전과 함께 많은 연구자들이 ESC 모델로 LLMs를 사용하고 있습니다. 그러나 이러한 LLM 기반 ESC의 평가는 여전히 불확실합니다. 역할 상호작용 에이전트의 놀라운 발전에 영감을 받아 우리는 ESC 모델과 상호작용하는 역할 상호작용 에이전트를 사용하는 ESC 평가 프레임워크(ESC-Eval)를 제안하며, 이는 상호작용 대화의 수동 평가로 이어집니다. 구체적으로, 우리는 먼저 역할 상호작용 에이전트의 역할을 정의하기 위해 7개의 기존 데이터 세트에서 2,801개의 역할 카드 를 재조직합니다. 두 번째로, 우리는 GPT-4보다 혼란스러운 사람처럼 행동하는 특정 역할 상호작용 모델인 ESC-Role을 훈련합니다. 세 번째로, ESC-Role과 조직된 역할 카드를 통해 일반 AI-어시스턴트 LLM(예: ChatGPT)과 ESC 지향 LLM(예: ExTES-Llama)을 포함하여 14개의 LLM을 ESC 모델로 사용하는 실험을 체계적으로 수행합니다. 여러 ESC 모델의 상호작용 다중 턴 대화에 대한 종합적인 인간 주석을 수행합니다. 결과는 ESC 지향 LLM이 일반 AI-어시스턴트 LLM보다 우수한 ESC 능력을 나타내지만 여전히 인간 성능과의 격차가 있음을 보여줍니다. 또한 미래 ESC 모델의 점수 매기기 프로세스를 자동화하기 위해 우리는 주석 데이터로 훈련된 ESC-RANK를 개발하여 GPT-4의 35점을 초과하는 점수 성능을 달성했습니다. 우리의 데이터와 코드는 https://github.com/haidequanbu/ESC-Eval에서 이용 가능합니다.
Zhao 외(금요일,)은 이 질문을 연구했습니다.