Key points are not available for this paper at this time.
L'appariement image-texte par des modèles profonds a récemment réalisé des avancées remarquables dans de nombreuses tâches, telles que la légende d'image et la recherche d'image. Un défi majeur de l'appariement entre l'image et le texte réside dans le fait qu'ils ont généralement des relations sous-jacentes complexes et que simplement modéliser ces relations peut conduire à des performances sous-optimales. Dans cet article, nous développons une nouvelle approche, les Réseaux d'Attention Spatial-Sémantique Bi-Directionnels (BSSAN), qui tire parti à la fois de la relation mot à régions (W2R) et de la relation objet d'image à mots (O2W) dans un cadre profond holistique pour un appariement plus efficace. Plus précisément, pour encoder efficacement la relation W2R, nous adoptons LSTM avec une fonction d'attention bilinéaire pour inférer les régions d'image qui sont plus liées à des mots particuliers, ce qui est appelé le réseau d'attention W2R. D'autre part, le réseau d'attention O2W est proposé pour découvrir les mots sémantiquement proches pour chaque objet visuel dans l'image, c'est-à-dire la relation objet visuel à mots (O2W). Ensuite, un modèle profond unifiant les deux réseaux d'attention directionnels dans un cadre d'apprentissage holistique est proposé pour apprendre les scores d'appariement des paires image et texte. Comparé aux méthodes existantes d'appariement image-texte, notre approche atteint des performances de pointe sur les ensembles de données de Flickr30K et MSCOCO.
Huang et al. (Mon,) ont étudié cette question.
Synapse has enriched 2 closely related papers on similar clinical questions. Consider them for comparative context: