Key points are not available for this paper at this time.
인터넷 사용자와 미디어 콘텐츠의 지속적인 증가로 인해 오디오와 비디오에서 증오 발언을 추적하는 것이 매우 어렵습니다. 비디오나 오디오를 텍스트로 변환해도 증오 발언을 정확하게 탐지하지 못합니다. 왜냐하면 인간은 때때로 증오적인 단어를 유머러스하거나 쾌활한 의미로 사용하고, 또한 비디오에서 다른 목소리 톤이나 다른 행동을 보이기 때문입니다. 최신의 증오 발언 탐지 모델은 대부분 단일 모달리티 기반으로 개발되었습니다. 본 연구에서는 오디오, 텍스트에서 추출한 특성 값과 특성 이미지를 추출하여 비디오 콘텐츠에서 증오 발언을 탐지하기 위한 다중 모달 시스템의 결합 접근 방식을 제안합니다.
Boishakhi 외 (수요일)이 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: