Key points are not available for this paper at this time.
Une correspondance efficace d'image et de phrase dépend de la manière dont on mesure bien leur similarité visuelle-sémantique globale. En nous basant sur l'observation qu'une telle similarité globale provient d'une agrégation complexe de multiples similarités locales entre les instances par paires d'images (objets) et de phrases (mots), nous proposons un réseau Long Short-Term Memory multimodal sélectif (sm-LSTM) pour la correspondance d'image et de phrase consciente des instances. Le sm-LSTM inclut un schéma d'attention modulée par le contexte multimodal à chaque étape temporelle qui peut s'attacher sélectivement à une paire d'instances d'image et de phrase, en prédisant des cartes de saillance conscientes des instances par paires pour l'image et la phrase. Pour les instances par paires sélectionnées, leurs représentations sont obtenues sur la base des cartes de saillance prédites, puis comparées pour mesurer leur similarité locale. En mesurant de manière similaire plusieurs similarités locales dans quelques étapes temporelles, le sm-LSTM les agrège séquentiellement avec des états cachés pour obtenir un score de correspondance final en tant que similarité globale souhaitée. Des expériences approfondies montrent que notre modèle peut bien associer des images et des phrases avec un contenu complexe, et atteindre des résultats à la pointe de la technologie sur deux ensembles de données de référence publics.
Huang et al. (Thu,) ont étudié cette question.