Key points are not available for this paper at this time.
심층 컨볼루션 신경망(CNN)은 단일 레이블 이미지 분류에서 향상된 성능을 보여주었으며, CNN 방법을 이용한 다중 레이블 이미지 분류에 대한 다양한 발전이 이루어졌습니다. 이는 단일 샷에서 객체, 속성, 장면 카테고리 등을 주석으로 달아야 합니다. 최근 최첨단 다중 레이블 이미지 분류 접근법은 이미지에서 레이블 의존성을 활용하여 전반적인 수준에서 레이블링 능력을 크게 향상시킵니다. 그러나 작은 객체와 시각적 개념을 예측하는 것은 여전히 글로벌 시각적 특징의 제한된 식별로 인해 도전적입니다. 본 논문에서는 이 문제를 해결하기 위해 지역 잠재 의미 의존성 모델(RLSD)을 제안합니다. 사용된 모델은 다수의 높은 의존성을 가진 레이블을 포함할 수 있는 지역을 로컬라이즈하기 위한 완전 컨볼루션 로컬라이제이션 아키텍처를 포함합니다. 로컬라이즈된 지역은 지역 수준에서 잠재적 의미 의존성을 특성화하기 위해 순환 신경망(RNN)으로 전송됩니다. 여러 벤치마크 데이터셋에 대한 실험 결과에 따르면, 제안된 모델은 최신 모델과 비교했을 때 우수한 성능을 보여주며, 특히 이미지에서 발생하는 작은 객체 예측에 있어 가장 좋은 성능을 달성합니다. 추가적으로, 훈련 중 경계 상자 좌표를 이용한 상한 모델(RLSD+ft-RPN)을 설정하였으며, 실험 결과는 경계 상자 주석을 사용하지 않고도 RLSD가 상한에 접근할 수 있음을 보여줍니다. 이는 실제 세계에서 더욱 현실적입니다.
Zhang et al. (Sun,)은 이 질문을 연구했습니다.