Key points are not available for this paper at this time.
방대한 훈련 데이터를 활용하여, 다중 모달 대형 언어 모델(MLLMs)은 뛰어난 일반 시각 이해 능력을 보여주었고 다양한 작업에서 놀라운 성과를 이루었습니다. 그러나 시각 문서 이해에서의 성능은 여전히 개선이 필요합니다. 이러한 불일치는 주로 시각 문서 이해가 세밀한 예측 작업이라는 사실에 기인합니다. 자연 장면에서 MLLMs는 일반적으로 저해상도 이미지를 사용하여 상당한 시각 정보 손실을 초래합니다. 더욱이, 일반 목적의 MLLMs는 문서 지향 지침을 처리하는 데 뛰어나지 않습니다. 본 논문에서는 MLLMs와 시각 문서 이해 간의 간극을 메우는 고해상도 시각 문서 도우미(HRVDA)를 제안합니다. 이 모델은 콘텐츠 필터링 메커니즘과 지침 필터링 모듈을 사용하여 콘텐츠 비의존적인 시각 토큰과 지침 비의존적인 시각 토큰을 각각 필터링하여 고해상도 이미지에 대한 효율적인 모델 훈련 및 추론을 달성합니다. 또한, 우리는 문서 지향 시각 지침 조정 데이터 세트를 구축하고 다단계 훈련 전략을 적용하여 모델의 문서 모델링 기능을 향상시킵니다. 광범위한 실험을 통해 우리의 모델이 여러 문서 이해 데이터 세트에서 최첨단 성능을 달성하면서 훈련 효율성과 저해상도 모델과 유사한 추론 속도를 유지함을 보여줍니다.
Liu et al. (수요일)이 이 질문을 연구하였습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: