Key points are not available for this paper at this time.
이미지-문장 검색은 유망한 응용으로 인해 멀티미디어 및 컴퓨터 비전에서 광범위한 연구 관심을 끌었습니다. 주요 문제는 시각적 및 텍스트 표현을 공동으로 학습하여 그 유사성을 정확하게 추정하는 것입니다. 이를 위해 주류 체계는 객체-단어 기반 주의를 채택하여 이들의 관련성 점수를 계산하고 주의 특징으로 상호작용 표현을 정제하지만, 이는 문장 내의 술어와 일치하는 객체 표현의 문맥을 간과합니다. 본 논문에서는 이미지-문장 검색을 위해 객체와 단어 간의 내적 및 외적 의미를 상관시키는 교차 모달 의미 강화 상호작용 방법인 CMSEI를 제안합니다. 특히, 우리는 먼저 객체의 공간 위치와 장면 그래프의 명시적 관계에 의해 안내되는 객체의 의미 표현을 강화하기 위해 내적 모달 공간 및 의미 그래프 기반 추론을 설계합니다. 그런 다음, 시각적 및 텍스트 의미 표현은 외적 모달 상호작용 주의 및 교차 모달 정렬을 통해 공동으로 정제됩니다. 객체의 맥락과 텍스트 맥락을 연관시키기 위해, 우리는 교차 레벨 객체-문장 및 단어-이미지 기반 상호작용 주의를 통해 시각적 의미 표현을 추가로 정제합니다. 7개의 표준 평가 메트릭에 대한 실험 결과는 제안된 CMSEI가 MS-COCO 및 Flickr30K 벤치마크에서 최첨단 및 대체 접근 방식을 능가함을 보여줍니다.
Ge et al. (Sun,)이 이 질문을 연구했습니다.
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: