Key points are not available for this paper at this time.
최근 대규모 언어 모델(LLM) 개발자들 사이에서 LLM 기반 문서 읽기 시스템에 대한 관심이 높아지고 있습니다. 이러한 시스템은 사용자가 자신의 문서를 업로드하고 문서 내용과 관련된 질문을 할 수 있게 하여 단순한 독해 작업을 넘어섭니다. 따라서 이러한 시스템은 파일 파싱, 메타데이터 추출, 다중 모달 정보 이해 및 긴 문맥 읽기와 같은 문제를 해결하기 위해 신중하게 설계되었습니다. 그러나 현재 이러한 시나리오에서 성능을 평가할 수 있는 벤치마크는 존재하지 않습니다. 이 문서에서는 LLM 기반 문서 읽기 시스템을 평가하기 위해 설계된 새로운 벤치마크인 DocBench를 소개합니다. 우리의 벤치마크는 인적 주의자의 모집 및 합성 질문 생성 등을 포함하여 면밀히 마련된 프로세스를 포함합니다. 5개의 서로 다른 도메인과 4개의 주요 질문 유형을 아우르는 229개의 실제 문서와 1,102개의 질문이 포함되어 있습니다. 우리는 웹 인터페이스나 API를 통해 접근할 수 있는 독점 LLM 기반 시스템과 오픈소스 LLM을 사용하는 파싱-후-읽기 파이프라인을 평가합니다. 우리의 평가는 기존 LLM 기반 문서 읽기 시스템과 인간 성과 간의 뚜렷한 격차를 드러내며, 숙련된 시스템 개발의 어려움을 강조합니다. 요약하자면, DocBench는 다양한 실제 시나리오에서 LLM 기반 문서 읽기 시스템을 평가하기 위한 표준화된 벤치마크를 설정하여 이 연구 분야의 미래 발전을 안내하는 것을 목표로 합니다.
Zou et al. (Mon,)은 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: