Key points are not available for this paper at this time.
Cet article présente un nouveau cadre pour la reconnaissance des activités humaines à partir de séquences vidéo capturées par une caméra de profondeur. Nous regroupons les normales d'hypersurface dans une séquence de profondeur pour former le polynormal, qui est utilisé pour caractériser conjointement l'information de mouvement local et de forme. Afin de capturer globalement les ordres spatiaux et temporels, une pyramide spatio-temporelle adaptative est introduite pour subdiviser une vidéo de profondeur en un ensemble de grilles espace-temps. Nous proposons ensuite un nouveau schéma d'agrégation des polynormals de bas niveau dans le vecteur super normal (SNV), qui peut être considéré comme une version simplifiée de la représentation du noyau de Fisher. Dans des expérimentations étendues, nous obtenons des résultats de classification supérieurs à tous les résultats précédemment publiés sur les quatre ensembles de données de référence publiques, à savoir MSRAction3D, MSRDailyActivity3D, MSRGesture3D et MSRActionPairs3D.
Yang et al. (Sun,) ont étudié cette question.