준구조화 문서는 다양한 비정형 레이아웃에 배치된 다양한 혼합 데이터 요소(예: 표, 차트, 계층적 단락)를 통합합니다. 이러한 문서는 여러 분야에서 널리 관찰되며 실제 데이터의 큰 부분을 차지합니다. 그러나 기존 방법은 세 가지 주요 기술적 문제로 인해 이러한 문서에 대한 자연어 질문 답변을 지원하는 데 어려움을 겪고 있습니다: (1) OCR과 같은 기술로 추출된 요소는 종종 분열되고 원래의 의미적 맥락이 제거되어 분석에 적합하지 않습니다. (2) 기존 접근 방식은 문서 내의 계층 구조를 포착하는 효과적인 표현이 부족하며(예: 표를 중첩된 장 제목과 연결하기) 레이아웃별 구분을 유지하는 데 한계가 있습니다(예: 사이드바와 주요 콘텐츠를 구분하기). (3) 질문에 답변하려면 종종 여러 지역 또는 페이지에 흩어져 있는 관련 정보를 검색하고 정렬해야 하며, 이는 서술 단락을 문서 내의 다른 위치에 있는 표 셀에 연결하는 것을 포함합니다. 이러한 문제를 해결하기 위해 우리는 준구조화 문서 분석을 위한 LLM 기반 시스템인 Modora를 제안합니다. 첫째, 우리는 로컬 정합 집계 전략을 채택하여 OCR 파싱된 요소를 레이아웃 인식 구성 요소로 변환하고 계층 제목 또는 비텍스트 요소가 있는 구성 요소에 대해 유형별 정보 추출을 수행합니다. 둘째, 구성 요소 간 관계 및 레이아웃 구분을 명확하게 모델링하기 위해 하향식 캐스케이드 요약 프로세스를 통해 CCTree(구성 요소 상관 트리)를 설계하여 구성 요소를 계층적으로 조직합니다. 마지막으로, 우리는 (1) 위치 기반 검색을 위한 레이아웃 기반 그리드 분할 및 (2) 의미 기반 검색을 위한 LLM 유도 가지치기 지원하며 질문 유형 인식 검색 전략을 제안합니다. 실험 결과 MoDora가 정확도에서 기준선보다 5.97%-61.07% 향상되었음을 보여줍니다. 코드는 https://github.com/weAIDB/MoDora 에 있습니다.
BangRui 외(월) 이 질문을 연구했습니다.