Key points are not available for this paper at this time.
Semi-supervised Video-Objektsegmentierung ist eine Aufgabe, bei der das Zielobjekt in einer Video.sequence segmentiert werden soll, wobei nur eine Maskenannotation im ersten Frame gegeben ist. Die begrenzte verfügbare Information macht diese Aufgabe äußerst herausfordernd. Die meisten zuvor besten Methoden verwenden übereinstimmungsbasierte transduktive Schlussfolgerungen oder online induktives Lernen. Dennoch sind sie entweder weniger differenzierend für ähnliche Instanzen oder unzureichend in der Nutzung von spatio-temporalen Informationen. In dieser Arbeit schlagen wir vor, transduktives und induktives Lernen in ein einheitliches Framework zu integrieren, um die Komplementarität zwischen diesen beiden zu nutzen und eine genaue und robuste Videoobjektsegmentierung zu erreichen. Der vorgeschlagene Ansatz besteht aus zwei funktionalen Zweigen. Der Transduktionszweig verwendet eine leichte Transformer-Architektur, um reichhaltige spatio-temporale Hinweise zu aggregieren, während der Induktionszweig online induktives Lernen durchführt, um differenzierende Zielinformationen zu erhalten. Um diese beiden unterschiedlichen Zweige zu verbinden, wird ein zweiköpfiger Label-Encoder eingeführt, um den geeigneten Zielprior für jeden von ihnen zu lernen. Die erzeugten Maskencodierungen werden zusätzlich dazu gezwungen, entflochten zu werden, um ihre Komplementarität besser zu bewahren. Umfassende Experimente an mehreren verbreiteten Benchmark-Datensätzen zeigen, dass der vorgeschlagene Ansatz ohne den Bedarf an synthetischen Trainingsdaten eine Reihe neuer Spitzenleistungen erzielt. Der Code ist verfügbar unter https://github.com/maoyunyao/JOINT.
Mao et al. (Fri,) haben diese Frage untersucht.