현재 대형 언어 모델(LLMs)과 비전-언어 대형 모델(LVLMs)은 단일 턴 작업에서 뛰어난 성능을 보이나, 깊은 맥락 이해와 복잡한 시각적 추론을 요구하는 다중 턴 상호 작용에서는 상당한 도전에 직면해 있으며, 이는 종종 단편적 추론, 맥락 손실 및 환각으로 이어집니다. 이러한 한계를 극복하기 위해, 우리는 LVLM에 강력하고 일관된 다중 턴 시각-텍스트 추론 능력을 부여하기 위해 설계된 새로운 프레임워크인 맥락 인식 다중 턴 시각 추론(CAMVR)을 제안합니다. CAMVR은 두 가지 주요 혁신을 도입합니다: 시각-텍스트 맥락 메모리 유닛(VCMU), 중요한 시각적 특징, 텍스트 의미 표현 및 각 상호 작용 턴의 교차 모달 일치를 저장하고 관리하는 동적 읽기-쓰기 메모리 네트워크; 그리고 적응형 시각 초점 안내(AVFG) 메커니즘은 VCMU의 맥락을 활용하여 시각 인코더의 주의를 맥락적으로 관련된 이미지 영역에 동적으로 조정합니다. 우리의 다층적 추론 통합 전략은 응답 생성이 현재 입력과 축적된 역사적 맥락 모두와 깊게 일관되도록 보장합니다. VisDial, 수정된 A-OKVQA 및 우리의 새로운 다중 턴 지시 따르기(MTIF) 데이터셋을 포함한 도전적인 데이터셋에 대한 광범위한 실험은 CAMVR이 지속적으로 최첨단 성능을 달성함을 보여줍니다.
Shen et al. (Sat,)은 이 질문을 연구했습니다.