전통적인 시각 질문 응답(VQA) 작업은 표면 이미지-텍스트 일치를 중점적으로 다루지만, 시각 텍스트 질문 응답(VTQA) 작업은 더 깊은 교차 모달 추론을 요구합니다. 현재의 Transformer 기반 모델은 효과적인 특징을 선별하는 데 부족합니다. 이 문제를 해결하기 위해 본 논문은 푸리에 주파수 영역과 공간 영역 자기 주의 및 그래프 주의 메커니즘을 통합한 새로운 교차 미디어 추론 네트워크(VTFCGNet)를 제안합니다. 이 네트워크는 서로 다른 모달 간의 특징 상호작용에 대해 적응적으로 가중치를 부여하고, 이미지, 텍스트, 질문 모달의 깊은 융합을 달성하며, VTQA 작업에서 기존 모델의 한계를 극복할 수 있습니다. VTFCGNet은 먼저 푸리에 주파수 영역과 공간 영역 모두에서 개체 추출 네트워크(VTFC-Net)를 기반으로 주요 개체를 추출하여 전통적인 자기 주의 메커니즘에 비해 불필요한 특징의 간섭을 줄입니다. 둘째, 다단계 교차 미디어 추론을 위해 교차 미디어 추론 네트워크(CRG-Net)를 사용하여 기존 VQA 모델에 비해 정교한 특징을 포착하고 교차 모달 관계를 모델링하는 능력을 크게 향상시킵니다. 마지막으로, 지역 제안의 격자 수준 및 지역 수준 시각 특징을 모두 사용하여 VTQA 및 VQA v2 데이터 세트에 대한 포괄적인 실험이 VTFCGNet의 뛰어난 성능을 검증합니다. 연구 결과에 따르면 VTFCGNet은 VQA v2 test-dev 및 VTQA test (영어 버전) 데이터 세트에서 각각 71.93% 및 75.83%의 최고 정확도를 달성했습니다.
Huo et al. (Sun,)은 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: