Key points are not available for this paper at this time.
O reconhecimento de ação baseado em esqueleto (SAR) em vídeos é uma tarefa importante, mas desafiadora, na visão computacional. Os modelos state-of-the-art recentes para SAR são principalmente baseados em redes neurais convolucionais de grafos (GCNs), que são poderosas na extração da informação espacial dos dados esqueléticos. No entanto, ainda não está claro se tais modelos baseados em GCN podem capturar efetivamente as dinâmicas temporais das sequências de ações humanas. Para isso, propomos o módulo DevLSTM, que explora o desenvolvimento de caminhos -- uma representação fundamentada e parcimoniosa para dados sequenciais ao aproveitar a estrutura do grupo de Lie. O desenvolvimento de caminhos, originado da teoria dos caminhos ásperos, pode capturar efetivamente a ordem dos eventos em dados de fluxo de alta dimensão com grande redução de dimensão e, consequentemente, melhorar substancialmente o módulo LSTM. Nosso módulo G-DevLSTM proposto pode ser convenientemente integrado ao grafo temporal, complementando modelos avançados existentes baseados em GCN. Nossos estudos empíricos nos conjuntos de dados NTU60, NTU120 e Chalearn2013 demonstram que nosso modelo híbrido proposto supera significativamente os métodos atualmente de melhor desempenho nas tarefas de SAR. O código está disponível em https://github.com/DeepIntoStreams/GCN-DevLSTM.
Jiang et al. (Sex,) estudaram esta questão.