Key points are not available for this paper at this time.
La légende vidéo est une tâche difficile, qui vise à générer une phrase pour décrire le contenu d'une vidéo en utilisant le langage naturel. De nombreuses méthodes existantes modélisent des caractéristiques visuelles (2D/3D) extraites des vidéos pour générer des légendes, mais elles négligent l'orientation sémantique. Empiriquement, les caractéristiques visuelles contiennent des informations détaillées telles que la couleur et la forme, tandis que la génération de légendes nécessite une attention plus soutenue aux indices sémantiques et syntaxiques qui ne peuvent pas être étudiés adéquatement uniquement à partir de la perte de légende. Pour atténuer ce problème, nous proposons un réseau guidé par sémantique basé sur l'apprentissage contrastif (SNCL), qui utilise à la fois des informations visuelles et textuelles pour enrichir les caractéristiques avec une orientation contextuelle. Sur la base des caractéristiques significatives, des modules de raisonnement hiérarchique sont utilisés pour effectuer la tâche de prédiction de phrases clés afin d'améliorer notre modèle avec une orientation sémantique spécifique. Les résultats expérimentaux sur les ensembles de données MSVD et MSR-VTT montrent que notre SNCL surpasse les méthodes récentes à la pointe de la technologie.
Chen et al. (Mon,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: