CLIP과 같은 비전-언어 모델(VLMs)은 대조 학습을 통해 교차 모달 의미 정렬을 달성하며, 강력한 제로샷 일반화를 보여줍니다. 그러나 기존의 프롬프트 엔지니어링은 주로 거친 범주 레이블에 의존하여 세밀한 지역적 의미를 간과합니다. 기존 접근 방식은 VLM이 본질적으로 지역화된 시각적 세부 사항을 인식한다고 가정하고, 대형 언어 모델에 의해 생성된 속성 설명자로 텍스트 프롬프트를 증강함으로써 분류를 향상시키려 합니다. 그러나 우리의 체계적인 실험은 중요한 한계를 드러냅니다: CLIP의 전반적인 이미지 패턴에 대한 강한 편향이 지역화된 시각적 설명자를 처리하는 능력을 방해합니다. 이 근본적인 제약을 해결하기 위해, 우리는 CLIP이 "숲과 나무를 모두 볼 수 있도록" 하는 간단하고 효과적인 플러그 앤 플레이 솔루션을 제안합니다. 구체적으로, 우리는 확률적 다중 크롭 증강을 사용하여 CLIP의 지역적 기능 분석을 위한 잠재적 능력을 활성화합니다. 부분적인 영역만을 크롭함으로써, 이 접근법은 모델의 수용 필드를 효과적으로 제한하고 주의 메커니즘의 다시 조정을 통해 본질적인 편향을 완화합니다. 제로샷, 수샷 및 테스트 시간 적응 설정 하에서 제안된 방법을 평가하며, 광범위한 실험 결과 D&D가 유망한 성과를 달성하는 것을 보여줍니다.
Xue et al. (2025)은 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: