Key points are not available for this paper at this time.
La segmentation d'objet vidéo utilise le premier masque vidéo annoté pour obtenir une segmentation cohérente et précise dans les images suivantes. Récemment, les méthodes basées sur la mémoire ont suscité une attention significative en raison de leurs améliorations de performance substantielles. Cependant, ces approches s'appuient sur une stratégie de mémoire globale fixe, ce qui pose un défi à la précision et à la vitesse de segmentation dans le contexte de vidéos plus longues. Pour atténuer cette limitation, nous proposons un nouveau modèle de segmentation d'objet vidéo semi-supervisé, fondé sur les principes du réseau de mémoire adaptatif. Notre modèle proposé extrait de manière adaptative les caractéristiques des objets en se concentrant sur la zone de l'objet tout en filtrant efficacement le bruit de fond extraneous. Un mécanisme d'identification est également appliqué avec soin pour discerner chaque objet dans des scénarios multi-objets. Pour réduire davantage la consommation de stockage sans compromettre la saillance des informations sur les objets, les caractéristiques obsolètes résidant dans le pool de mémoire sont compressées en caractéristiques saillantes grâce à l'utilisation d'un mécanisme d'auto-attention. De plus, nous introduisons un module de correspondance locale, spécialement conçu pour affiner les caractéristiques des objets en fusionnant les informations contextuelles provenant des images historiques. Nous démontrons l'efficacité de notre approche à travers des expériences, augmentant substantiellement à la fois la vitesse et la précision de la segmentation pour des vidéos longues, tout en maintenant une performance comparable pour les courtes vidéos. Le code source est disponible à l'adresse https://github.com/GQLi-cong/AMN.
Zhong et al. (Mon,) ont étudié cette question.