A localização de ações temporais com supervisão fraca (WTAL) visa detectar segmentos de ação em vídeos não editados usando apenas rótulos em nível de vídeo. Métodos existentes geralmente seguem o paradigma de aprendizado de múltiplas instâncias (MIL) com uma estratégia top-k, resultando frequentemente em localização de ação incompleta. Além disso, a natureza local e descontínua das ações causa a separação dos segmentos de ação, que carecem de interação temporal suficiente. Para abordar essas questões, este artigo introduz protótipos semânticos para enriquecer as representações de vídeo, permitindo que o modelo agregue pistas de ação em nível de categoria em vídeos e recupere segmentos semanticamente relevantes, mas pouco ativados, melhorando assim a completude da ação. Uma perda contrastiva de protótipo é empregada para melhorar a discriminabilidade das características. Além disso, uma unidade de interação temporal esparsa é projetada para modelar conjuntamente o contexto de curto prazo e as dependências de longo alcance. A perda guiada por limites utiliza as saídas de interação temporal para restringir explicitamente as respostas semânticas em torno dos limites de ação, promovendo transições nítidas e temporariamente consistentes. Com base nisso, este artigo propõe uma rede de interação temporal esparsa guiada por protótipos semânticos (S2Net), alcançando uma modelagem de vídeo unificada desde a compreensão semântica completa até a percepção de limites detalhados. Extensos experimentos em THUMOS14 e ActivityNet1.3 demonstram que o S2Net alcança uma localização de ação mais precisa e completa.
Wáng et al. (Quarta-feira,) estudaram essa questão.