구성 비디오 검색(CVR)은 새로운 비디오 검색 패러다임입니다. 전통적인 단일 모달 비디오 검색 패러다임(예: 텍스트에서 비디오로 또는 비디오에서 비디오로)과 달리, CVR은 참조 비디오와 자연어 수정을 모두 포함하는 다중 모달 쿼리를 사용하여 수정된 참조 비디오와 가장 잘 일치하는 대상 비디오를 검색합니다. 기존 CVR 방법은 주로 시각-언어 사전 훈련 모델의 일반화된 지식에 의존하거나 비디오 이해를 향상시키기 위해 캡션 확장을 사용합니다. 그러나 이러한 접근 방식은 다중 모달 쿼리 이해를 위한 비디오의 공유 가능성과 변동성이 제공하는 이점을 간과합니다. 이러한 한계를 극복하기 위해 shaREd 및 diFferential semantIcs eNhancement nEtwork(REFINE)라는 새로운 CVR 프레임워크를 도입합니다. REFINE은 비디오의 공유 가능성과 변동성을 활용하여 다중 모달 쿼리 이해를 향상시키는 첫 번째 프레임워크입니다. 구체적으로 REFINE은 학습 가능한 토큰을 활용하여 향상된 공유 기능 표현을 달성합니다. 또한, 프레임 간의 차별적 의미를 분리하기 위해 신중하게 설계된 차별 블록을 도입하고, 다중 모달 쿼리 특징 융합을 안내하기 위해 수정 연관성을 사용합니다. 이외에도 REFINE은 구성 이미지 검색 작업으로 확장되어 기존의 구성된 다중 모달 검색 시나리오에서 효과적으로 일반화하고 기존 방법보다 뛰어난 성능을 발휘합니다. 네 개의 벤치마크 데이터세트에서 수행된 포괄적인 질적 및 양적 평가 결과는 제안된 REFINE 프레임워크의 우수성을 입증합니다.
Hu et al. (토요일)은 이 질문을 연구했습니다.