Key points are not available for this paper at this time.
A correspondência eficaz de imagem e sentença depende de como medir bem sua similaridade visual-semântica global. Com base na observação de que tal similaridade global surge de uma agregação complexa de múltiplas similaridades locais entre instâncias pareadas de imagem (objetos) e sentença (palavras), propomos uma rede de Memória de Longo Prazo e Curto Prazo multimodal seletiva (sm-LSTM) para correspondência consciente de instâncias de imagem e sentença. A sm-LSTM inclui um esquema de atenção modulado por contexto multimodal em cada passo de tempo que pode prestar atenção seletivamente a um par de instâncias de imagem e sentença, prevendo mapas de saliência conscientes de instância pareados para imagem e sentença. Para instâncias pareadas selecionadas, suas representações são obtidas com base nos mapas de saliência previstos e, em seguida, comparadas para medir sua similaridade local. Medindo similaridades locais múltiplas dentro de poucos passos de tempo de forma semelhante, a sm-LSTM agrega sequencialmente essas similaridades com estados ocultos para obter uma pontuação de correspondência final como a desejada similaridade global. Experimentos extensivos mostram que nosso modelo pode corresponder bem imagem e sentença com conteúdo complexo e alcançar resultados de ponta em dois conjuntos de dados de benchmark públicos.
Huang et al. (Qui,) estudaram essa questão.