다중 모달 대규모 언어 모델(MLLM)의 다중 모달 추론 능력을 향상시키는 것은 커뮤니티에서 점점 더 주목받고 있는 도전 과제입니다. 최근 여러 연구에서는 MLLM의 추론 능력을 향상시키기 위해 검증 가능한 보상을 사용하는 강화 학습(RLVR)을 다중 모달 분야에 적용했습니다. 그러나 이러한 연구는 MLLM의 복잡한 다중 모달 추론의 핵심 전제조건이자 기본 구성 요소로서 다중 모달 인식 능력 향상을 간과하고 있습니다. McNemar의 테스트를 통해 기존 RLVR 방법이 MLLM의 다중 모달 인식 능력을 효과적으로 향상시키지 못하여, 추가적인 다중 모달 추론 개선을 제한한다는 것을 발견했습니다. 이러한 제한을 해결하기 위해, 우리는 MLLM이 시각적 콘텐츠를 정확하게 인식하도록 명시적으로 장려하는 새로운 시각적 인식 보상을 도입하는 Perception-R1을 제안합니다. 이를 통해 MLLM의 다중 모달 인식 및 추론 능력을 효과적으로 유도할 수 있습니다. 구체적으로, 우리는 먼저 다중 모달 문제의 CoT 경로에서 텍스트 기반의 시각적 주석을 수집하여, 보상 할당을 위한 시각적 참조로 사용합니다. RLVR 훈련 중, 우리는 시각적 주석과 MLLM이 생성한 응답 간의 일관성을 평가하기 위해 판단 LLM을 이용하고, 이러한 일관성 판단을 바탕으로 시각적 인식 보상을 할당합니다. 여러 다중 모달 추론 벤치마크에서 광범위한 실험을 통해, Perception-R1의 효과를 입증하며, 이는 1,442개의 훈련 데이터만으로도 대부분의 벤치마크에서 최첨단 성능을 달성합니다.
Xiao et al. (2025)는 이 질문을 연구했습니다.