현재의 의미 분할 방법은 주로 전역 이미지의 맥락을 모델링하여 고품질의 분할 결과를 얻는 데 집중합니다. 그러나 이들은 보완적이고 효과적인 맥락 정보를 포함하고 있는 지역 이미지 패치의 역할을 무시합니다. 본 논문에서는 전역 이미지와 지역 이미지 패치의 예측을 기반으로 하는 의미 분할을 위한 적응형 후처리 네트워크(APPNet)를 제안합니다. APPNet의 핵심은 전역 예측과 지역 예측 간의 맥락을 모델링하여 정확한 픽셀 단위 표현을 생성하는 글로벌-로컬 집계 모듈입니다. 또한 우리는 전역 예측의 세부 정보 부족과 지역 예측의 과신 문제를 보완하기 위해 적응형 포인트 교체 모듈을 개발했습니다. 우리의 방법은 기존의 분할 방법(즉, ConvNeXt, HRNet, ViT-Adapter)에 거의 메모리 소모 없이 추가 수정 없이 쉽게 통합할 수 있습니다. 우리는 다양한 데이터셋(즉, Cityscapes, ADE20K, PASCAL-Context, COCO-Stuff)에서 방법이 성능 개선을 가져오음을 경험적으로 증명합니다. 코드와 모델은 https://github.com/zhu-gl-ux/APPN 에서 공개될 예정입니다.
Zhu et al. (Tue,)는 이 질문을 연구했습니다.