대규모 언어 모델(LLMs)은 정보 탐색을 위한 널리 사용되는 도구로 부상하였으나, 이들이 생성한 출력물은 환각에 취약합니다. 본 연구의 목표는 LLMs가 인용과 함께 텍스트를 생성할 수 있도록 하여 사실적 정확성과 검증 가능성을 향상시키는 것입니다. 기존 연구는 주로 상업적 검색 엔진과 인간 평가에 의존하고 있어 다양한 모델링 접근 방식을 재현하고 비교하기 어렵습니다. 우리는 자동 LLM 인용 평가를 위한 첫 번째 벤치마크인 ALCE를 제안합니다. ALCE는 다양한 질문과 검색 코퍼스를 수집하며, 지원 증거를 검색하고 인용과 함께 답변을 생성하기 위한 엔드 투 엔드 시스템 구축이 필요합니다. 우리는 유창성, 정확성 및 인용 품질의 세 가지 차원에서 자동 지표를 개발하였으며, 이들이 인간의 판단과 강한 상관관계가 있음을 입증하였습니다. 최신 LLM 및 새로운 프롬프트 전략과의 실험은 현재 시스템이 상당한 개선 여지를 가지고 있음을 보여줍니다. 예를 들어, ELI5 데이터 세트에서는 가장 우수한 모델조차도 50%의 경우 완전한 인용 지원이 부족합니다. 우리의 분석은 더 나은 검색기 개발, 장기 맥락 LLM 발전 및 여러 출처에서 정보를 종합하는 능력 개선 등 유망한 미래 방향을 강조합니다.
Gao 외 (2023)은 이 질문을 연구했다.
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: