Key points are not available for this paper at this time.
텍스트 기반 인물 검색 (TPR)은 텍스트 쿼리에 따라 목표 인물 이미지를 검색하는 것을 목표로 합니다. 주요 도전 과제는 비전과 언어 모달리티 간의 상당한 격차를 해소하는 것인데, 특히 대규모 데이터셋이 제한된 경우에 더욱 그렇습니다. 본 논문에서는 TPR을 위한 CLIP 기반 시너지 지식 전이 (CSKT) 접근 방식을 소개합니다. 구체적으로, CLIP의 입력 측 지식을 탐색하기 위해 먼저 텍스트-이미지 및 이미지-텍스트의 양방향 프롬프트와 결합된 투영으로 구성된 양방향 프롬프트 전이 (BPT) 모듈을 제안합니다. 둘째, 다중 헤드 자기 주의(MHA)의 출력 측에서 비전과 언어 간의 지식을 전이하기 위해 이중 어댑터 전이 (DAT)를 설계하였습니다. 이 시너지적 양방향 협업 메커니즘은 초기 단계의 특징 융합을 촉진하고 CLIP의 기존 지식을 효율적으로 활용합니다. CSKT는 훈련 매개변수가 전체 모델의 7.4%에 불과한 상황에서도 세 가지 벤치마크 데이터셋에서 최첨단 접근 방식을 능가하며, 그 효율성, 효과성 및 일반화를 입증합니다.
Liu et al. (월) 이 질문을 연구했습니다.