Key points are not available for this paper at this time.
Cada vez mais, os usuários estão se acostumando a postar imagens e textos em redes sociais para compartilhar suas emoções ou opiniões. Assim, a análise multimodal de sentimentos se tornou um tópico de pesquisa de interesse crescente nos últimos anos. Tipicamente, existem regiões afetivas que evocam sentimentos humanos em uma imagem, que geralmente são manifestadas por palavras correspondentes nos comentários das pessoas. Da mesma forma, as pessoas também tendem a retratar as regiões afetivas de uma imagem ao compor descrições de imagem. Como resultado, a relação entre regiões afetivas da imagem e o texto associado é de grande importância para a análise multimodal de sentimentos. No entanto, a maioria das abordagens existentes de análise multimodal de sentimentos simplesmente concatena características da imagem e do texto, o que pode não explorar totalmente a interação entre eles, levando a resultados subótimos. Motivados por essa observação, propomos uma nova rede de interação imagem-texto (ITIN) para investigar a relação entre regiões afetivas de imagem e texto para análise multimodal de sentimentos. Especificamente, introduzimos um módulo de alinhamento cross-modal para capturar a correspondência região-palavra, com base na qual as características multimodais são fundidas através de um módulo adaptativo de porte cross-modal. Além disso, considerando o papel complementar da informação contextual na análise de sentimentos, integramos as representações de características contextuais de modo individual para alcançar previsões mais confiáveis. Resultados experimentais extensivos e comparações em conjuntos de dados públicos demonstram que o modelo proposto é superior aos métodos de ponta.
Zhu et al. (Qua,) estudaram essa questão.