Key points are not available for this paper at this time.
텍스트-비디오 검색 (TVR)은 관련 비디오 콘텐츠를 자연어 쿼리와 정렬하는 것을 목표로 합니다. 현재까지 대부분의 최첨단 TVR 방법은 대규모 사전 학습된 비전-언어 모델(예: CLIP)을 기반으로 이미지-비디오 전이 학습을 학습합니다. 그러나 이러한 사전 학습된 모델을 TVR에 대해 완전히 미세 조정하는 것은 비용이 매우 비쌉니다. 이를 위해 우리는 희소하고 상관된 어댑터(RAP)를 이용하여 효율적인 텍스트-비디오 검색을 수행할 것을 제안합니다. 즉, 몇 개의 매개변수화된 레이어로 사전 학습된 모델을 미세 조정합니다. 텍스트-비디오 시나리오를 수용하기 위해, 우리는 RAP에 두 가지 필수 특성인 시간적 희소성 및 상관성을 장착합니다. 구체적으로, 우리는 고정된 CLIP 백본에서 이미지별 특징을 정제하는 저랭크 변조 모듈을 제안합니다. 이 모듈은 비디오 특징 내에서 두드러진 프레임을 강조하는 동시에 시간적 중복성을 완화합니다. 또한, 우리는 먼저 가장 반응이 좋은 시각 패치들을 선택하고, 이들 간의 상관 모델링을 학습 가능한 시간적 및 패치 오프셋으로 증강하는 비동기적 자기 주의 메커니즘을 도입합니다. 네 개의 TVR 데이터 세트에 대한 광범위한 실험에서 RAP는 완전히 미세 조정된 대응 모델 및 기타 파라미터 효율적인 미세 조정 방법에 비해 우수하거나 comparable한 성과를 달성함을 보여줍니다.
Cao et al. (수요일,)은 이 질문을 연구했습니다.