Key points are not available for this paper at this time.
최근 이미지-텍스트 매칭 작업은 컴퓨터 비전 분야에서 많은 주목을 받고 있습니다. 이 크로스 도메인 문제의 핵심은 시각적 및 텍스트적 내용 간의 유사성을 정확하게 측정하는 방법이며, 이는 두 가지 양식 모두에 대한 세밀한 이해를 요구합니다. 본 논문에서는 시각적 및 텍스트적 관점 간의 관계를 조사하기 위해 새로운 위치 집중 주의 네트워크(PFAN)를 제안합니다. 본 연구에서는 객체 위치 단서를 통합하여 시각-텍스트 공동 임베딩 학습을 향상시킵니다. 먼저 이미지를 블록으로 나누어 이미지 내 영역의 상대 위치를 추론합니다. 그런 다음, 이미지 영역과 블록 간의 관계를 모델링하고, 가치 있는 위치 특성을 생성하기 위한 주의 메커니즘을 제안합니다. 이는 지역 표현을 향상시키고 시각적 이미지와 텍스트 문장 간의 더 신뢰할 수 있는 관계를 모델링하는 데 활용됩니다. 인기 있는 데이터셋인 Flickr30K와 MS-COCO에서 제안된 방법의 효과를 보여주는 실험 결과를 얻었습니다. 공공 데이터셋 외에도, 우리는 제안된 방법의 실제 응용 가치를 검증하기 위해 우리가 수집한 실제 뉴스 데이터셋(Tencent-News)에서 실험을 수행했습니다. 우리가 아는 한, 이는 실제 응용에서 성능을 테스트하는 첫 번째 시도입니다. 우리의 방법은 이 세 가지 데이터셋 모두에서 최첨단 성능을 달성할 수 있습니다.
Wang et al. (Sun,)이 이 질문을 연구했습니다.