Key points are not available for this paper at this time.
밀집 시각 인식 문제, 특히 의미 분할에 대한 딥 러닝의 상당한 발전에도 불구하고, 전통적인 방법은 고정된 클래스 집합에 의해 제한됩니다. 한편, CLIP과 같은 비전-언어 기초 모델은 그들의 강력한 일반화 능력 덕분에 수많은 제로샷 이미지 레벨 작업에서remarkable 효능을 보여주었습니다. 최근 이러한 모델을 오픈 어휘 의미 분할(OVSS)에 활용하는 작업이 진행되고 있습니다. 그러나 기존 접근법은 종종 비현실적인 감독 구조 사전 훈련이나 추가 사전 훈련된 네트워크에 의존합니다. 이 작업에서는 NACLIP(Neighbor-Aware CLIP)라는 트레이닝 없는 OVSS의 강력한 기준선을 제안합니다. 이는 이 시나리오에 맞춰 조정된 CLIP의 간단한 적응을 나타냅니다. 우리 방법은 CLIP의 비전 트랜스포머에 대한 자기 주의 내에서 패치의 위치를 강제하는데, 이는 밀집 예측 작업에 중요하지만 OVSS 문헌에서는 간과되었습니다. 분할을 선호하는 설계 선택을 통합함으로써, 우리 접근법은 추가 데이터, 보조 사전 훈련된 네트워크 또는 광범위한 하이퍼파라미터 튜닝 없이 성능을 상당히 개선하여 실제 애플리케이션에 매우 실용적입니다. 8개의 인기 있는 의미 분할 벤치마크에서 실험을 수행하여 대부분의 시나리오에서 최첨단 성능을 달성했습니다. 우리의 코드는 https://github.com/sinahmr/NACLIP 에서 공개적으로 이용 가능합니다.
Hajimiri 외(2024)는 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: