다중 모드 대형 언어 모델(MLLM)은 최근 AI 연구의 주요 초점입니다. 그러나 대부분의 이전 연구는 정적 이미지 이해에 중점을 두고 있으며, 연속 오디오-비디오 데이터 처리 능력은 여전히 충분히 탐구되지 않았습니다. 이러한 격차는 MLLM 성능을 실제 환경에서 체계적으로 평가하기 위한 고품질 벤치마크의 필요성을 강조합니다. 우리는 4,958개의 주석과 인구 통계 메타데이터를 포함한 13개의 실제 대화 도메인을 포괄하는 포괄적이고 완전히 사람에 의해 검증된 벤치마크인 SONIC-O1을 소개합니다. SONIC-O1은 열린 형식의 요약, 다중 선택 질문(MCQ) 응답 및 지원 근거(추론)를 포함한 주요 작업에서 MLLM을 평가합니다. 폐쇄 및 오픈 소스 모델에 대한 실험에서는 한계가 드러납니다. 두 모델 계열 간의 MCQ 정확도에서 성능 차이는 상대적으로 작지만, 최상의 폐쇄형과 오픈형 모델 간의 시간적 위치 선정에서 22.6%의 상당한 성능 차이를 관찰합니다. 성능은 인구 통계 그룹 간에 further 저하되어 모델 행동의 지속적인 불균형을 나타냅니다. 전반적으로 SONIC-O1은 시간적으로 기반이 있는 사회적으로 강건한 다중 모드 이해에 대한 개방형 평가 도구를 제공합니다. 우리는 재현성과 연구를 위해 SONIC-O1을 공개합니다: 프로젝트 페이지: https://vectorinstitute.github.io/sonic-o1/ 데이터셋: https://huggingface.co/datasets/vector-institute/sonic-o1 Github: https://github.com/vectorinstitute/sonic-o1 리더보드: https://huggingface.co/spaces/vector-institute/sonic-o1-leaderboard
Radwan 외(목요일)는 이 질문을 연구했습니다.