Key points are not available for this paper at this time.
다중 모달 감정 인식은 최근 몇 년 동안 상당한 발전을 이루었지만, 모달 간의 풍부한 시너지를 이루는 관계의 잠재력은 충분히 활용되지 않고 있습니다. 본 논문에서는 오디오, 비주얼, 텍스트 모달 간의 내적 및 외적 관계를 효과적으로 포착하기 위해 재귀적 공동 교차 모달 주의(RJCMA)를 소개합니다. 특히, 우리는 공동 오디오-비주얼-텍스트 특징 표현과 개별 모달의 특징 표현 간의 교차 상관을 기반으로 주의 가중치를 계산하여 모달 간의 내적 및 외적 관계를 동시에 포착합니다. 개별 모달의 주의된 특징들은 더 정교한 특징 표현을 얻기 위해 재귀적 메커니즘에서 융합 모델의 입력으로 다시 공급됩니다. 또한 개별 모달의 특징 표현의 시간적 모델링을 개선하기 위해 시간 컨볼루션 네트워크(TCN)를 탐색했습니다. 제안된 융합 모델의 성능을 평가하기 위해 도전적인 Affwild2 데이터셋에서 광범위한 실험이 수행되었습니다. 오디오, 비주얼, 텍스트 모달 간의 내적 및 외적 관계를 효과적으로 포착함으로써, 제안된 융합 모델은 검증 세트(테스트 세트)에서 각각 0.585 (0.542) 및 0.674 (0.619)의 일치 상관 계수(CCC)를 달성했습니다. 이는 검증 세트(테스트 세트)에서 각각 0.240 (0.211) 및 0.200 (0.191)의 기준선에 비해 상당한 개선을 보여주며, 제6회 야외 감정 행동 분석(ABAW) 경연의 감정-각성 도전에서 2위를 달성했습니다. 코드 는 GitHub에서 사용 가능합니다: https://github.com/praveena2j/RJCMA.
Praveen et al. (Mon,) 이 질문을 연구했습니다.
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: