Key points are not available for this paper at this time.
A Segmentação de Objetos em Vídeo (VOS) tem como objetivo rastrear objetos através de quadros em um vídeo e segmentá-los com base no quadro anotado inicial dos objetos-alvo. Trabalhos anteriores em VOS normalmente dependem de vídeos totalmente anotados para treinamento. No entanto, a aquisição de vídeos de treinamento totalmente anotados para VOS é trabalhosa e demorada. Enquanto isso, métodos de VOS auto-supervisionados tentaram construir sistemas VOS por meio de aprendizado de correspondência e propagação de rótulos. Ainda assim, a ausência de priors de máscara prejudica sua robustez em cenários complexos, e o paradigma de propagação de rótulos os torna impráticos em termos de eficiência. Para resolver essas questões, propomos, pela primeira vez, uma estrutura geral de treinamento de um único passo para VOS, que requer apenas um único quadro rotulado por vídeo de treinamento e é aplicável à maioria das redes VOS de ponta. Especificamente, nosso algoritmo consiste em: i) Inferir máscaras de objeto de forma temporal, com base no quadro rotulado inicial. ii) Reconstruir a máscara inicial do objeto de forma temporal inversa, utilizando as máscaras do passo i). Através deste treinamento bidirecional, uma rede VOS satisfatória pode ser obtida. Notavelmente, nossa abordagem é extremamente simples e pode ser empregada de ponta a ponta. Finalmente, nossa abordagem usa um único quadro rotulado dos conjuntos de dados YouTube-VOS e DAVIS para alcançar resultados comparáveis àqueles treinados em conjuntos de dados totalmente rotulados. O código será disponibilizado.
Chen et al. (Qua,) estudaram essa questão.