Key points are not available for this paper at this time.
La recherche d'images et de textes est une branche fondamentale et cruciale dans la récupération d'informations. Bien que des progrès significatifs aient été réalisés pour établir un lien entre la vision et le langage, cela reste un défi en raison du raisonnement intra-modal difficile et de l'alignement inter-modal. Les méthodes d'interaction de modalités existantes ont obtenu des résultats impressionnants sur des ensembles de données publiques. Cependant, elles dépendent fortement de l'expérience d'experts et du retour empirique concernant la conception des schémas d'interaction, manquant ainsi de flexibilité. Pour remédier à ces problèmes, nous développons un nouveau réseau de modélisation des interactions de modalités basé sur le mécanisme de routage, qui est le premier cadre d'interaction multimodale unifié et dynamique pour la recherche d'images et de textes. En particulier, nous concevons d'abord quatre types de cellules comme unités de base pour explorer différents niveaux d'interactions de modalités, puis les connectons dans une stratégie dense pour construire un espace de routage. Pour doter le modèle de la capacité de décision de chemin, nous intégrons un routeur dynamique dans chaque cellule pour l'exploration de schémas. Étant donné que les routeurs sont conditionnés par les entrées, notre modèle peut apprendre de manière dynamique différents chemins activés pour différentes données. D'importantes expériences sur deux ensembles de données de référence, à savoir Flickr30K et MS-COCO, vérifient la supériorité de notre modèle par rapport à plusieurs références de pointe.
Qu et al. (Sun,) ont étudié cette question.