Key points are not available for this paper at this time.
텍스트를 이미지로 취급하고, 프롬프트를 텍스트 레이블과 결합하여 프롬프트 튜닝을 하며, CLIP의 정렬 속성을 활용하는 방법이 제로샷 다중 레이블 이미지 인식에 성공적으로 적용되었습니다. 그럼에도 불구하고 시각 정보를 저장하기 위해 텍스트 레이블에만 의존하는 것은 시각 객체의 다양성을 나타내는 데 불충분합니다. 본 논문에서는 CLIP의 훈련 과정을 역전시키고 의사 시각 프롬프트의 개념을 도입하는 것을 제안합니다. 이 프롬프트는 각 객체 범주에 대해 초기화되며 대형 언어 모델에 의해 생성된 대규모 저비용 문장 데이터에 대해 사전 훈련됩니다. 이 과정은 CLIP에서 정렬된 시각 정보를 발굴하고 이를 클래스 특정 시각 프롬프트에 저장합니다. 그런 다음 대조 학습을 활용하여 저장된 시각 정보를 텍스트 레이블에 전송하여 그들의 시각 표현 능력을 향상시킵니다. 또한 원래의 CLIP에서 지식을 활용하고 다운스트림 데이터셋에서 얻은 새로운 학습 지식을 동시에 활용하는 이중 어댑터 모듈을 도입합니다. 의사 시각 프롬프트 덕분에, 우리 방법은 깨끗한 주석이 달린 텍스트 데이터뿐만 아니라 대형 언어 모델에 의해 생성된 의사 텍스트 데이터에서도 최첨단 성능을 초월합니다.
Xu et al. (2024)는 이 질문을 연구하였습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: