Key points are not available for this paper at this time.
Die Video-Personenwiedererkennung hat in den letzten Jahren große Aufmerksamkeit auf sich gezogen. Sie zielt darauf ab, Bildsequenzen von Fußgängern aus verschiedenen Kamerasichtweisen abzugleichen. Frühere Ansätze verbessern diese Aufgabe normalerweise aus drei Aspekten: 1) Auswahl von diskriminierbaren Frames; 2) Generierung informativerer zeitlicher Darstellungen; und 3) Entwicklung effektiverer Distanzmetriken. Um die oben genannten Probleme anzugehen, präsentieren wir eine neuartige und praktische tiefgehende Architektur für die Video-Personenwiedererkennung, die als Selbst- und kollaboratives Aufmerksamkeitsnetzwerk (SCAN) bezeichnet wird, welches die Videopaaren als Eingabe verwendet und deren Übereinstimmungsscores ausgibt. SCAN hat mehrere ansprechende Eigenschaften. Erstens verwendet SCAN einen nicht-parametrischen Aufmerksamkeitsmechanismus, um die intra-sequenzielle und inter-sequenzielle Merkmalsdarstellung von Videos zu verfeinern und gibt eine Selbst- und kollaborative Merkmalsdarstellung für jedes Video aus, wodurch die diskriminierbaren Frames zwischen der Probe- und Galeriesequenz ausgerichtet werden. Zweitens wird über die vorhandenen Modelle hinaus eine verallgemeinerte paarweise Ähnlichkeitsmessung vorgeschlagen, um die Ähnlichkeitsmerkmalsdarstellung des Video-Paares zu generieren, indem das Hadamard-Produkt ihrer Selbstrepräsentationsdifferenz und kollaborativen Repräsentationsdifferenz berechnet wird. Somit kann das Übereinstimmungsergebnis durch den binären Klassifikator vorhergesagt werden. Drittens wird eine dichte Clip-Segmentierungsstrategie eingeführt, um reichhaltige Probe-Galerie-Paare zu generieren, um das Modell zu optimieren. In der Testphase wird der endgültige Übereinstimmungsscore von zwei Videos bestimmt, indem die Scores der am besten bewerteten Clip-Paare gemittelt werden. Umfangreiche Experimente demonstrieren die Wirksamkeit von SCAN, das die Top-1-Genauigkeiten der am besten abschneidenden Baselines auf den Datensätzen iLIDS-VID, PRID2011 und MARS übertrifft.
Zhang et al. (Tue,) untersuchten diese Frage.