Key points are not available for this paper at this time.
La récupération de texte-vidéo (TVR) vise à aligner le contenu vidéo pertinent avec des requêtes en langage naturel. À ce jour, la plupart des méthodes de TVR à la pointe de la technologie apprennent le transfert d'apprentissage image-vidéo basé sur de grands modèles pré-entraînés de vision et de langage (par exemple, CLIP). Cependant, le réglage complet de ces modèles pré-entraînés pour la TVR entraîne des coûts de calcul prohibitifs. À cet égard, nous proposons d'effectuer une récupération efficace de texte-vidéo avec un AdaPteur sparse-et-corrélé (RAP), c'est-à-dire le réglage du modèle pré-entraîné avec quelques couches paramétrées. Pour s'adapter au scénario texte-vidéo, nous dotons notre RAP de deux caractéristiques indispensables : la sparsité temporelle et la corrélation. Plus précisément, nous proposons un module de modulation de faible rang pour affiner les caractéristiques par image du backbone CLIP gelé, ce qui accentue les images saillantes au sein des caractéristiques vidéo tout en allégeant la redondance temporelle. De plus, nous introduisons un mécanisme d'auto-attention asynchrone qui sélectionne d'abord les meilleurs patchs visuels réactifs et augmente la modélisation de corrélation entre eux avec des décalages temporels et de patchs apprenables. Des expériences étendues sur quatre ensembles de données de TVR montrent que le RAP atteint des performances supérieures ou comparables par rapport au modèle entièrement réglé et à d'autres méthodes de réglage efficaces en paramètres.
Cao et al. (Mer,) ont étudié cette question.