Key points are not available for this paper at this time.
다양한 지침 데이터셋의 혜택을 받은 현대의 대규모 언어 모델(LLMs)은 인간과 협력하는 AI 어시스턴트로서 효과적으로 작동합니다. 그러나 LLM은 여전히 챗봇 및 심리 상담과 같이 인간과 유사한 상호작용을 요구하는 실제 세계 응용 프로그램에서 자연스럽고 구어체로 응답을 생성하는 데 어려움을 겪고 있습니다. 이러한 제한을 해결하기 위해 우리는 중국어로 된 자연 상호작용 대화 데이터셋인 NICO를 소개합니다. 우리는 먼저 GPT-4-turbo를 사용하여 대화 초안을 생성하고 이를 일상 생활의 20개 주제와 5가지 유형의 사회적 상호작용을 다루게 합니다. 그런 다음 우리는 작업자를 고용하여 문법 오류와 부자연스러운 발화를 제거할 수 있도록 이러한 대화를 수정하게 합니다. 우리는 비자연스러운 문장을 식별하고 수정하기 위한 두 가지 대화 수준 자연 대화 작업과 두 가지 문장 수준 작업을 정의합니다. 여러 개의 오픈 소스 및 클로즈드 소스 LLM이 테스트되고 상세히 분석됩니다. 실험 결과는 작업의 도전 과제를 강조하고 NICO가 LLM의 자연스러운 대화 능력을 촉진하는 데 어떻게 기여할 수 있는지를 보여줍니다. 데이터셋은 출시될 예정입니다.
Sun et al. (토요일)이 이 질문을 연구했습니다.