Key points are not available for this paper at this time.
Percevoir des activités significatives dans une longue séquence vidéo est un problème complexe en raison de la définition ambiguë de « signification » ainsi que des encombrements dans la scène. Nous abordons ce problème en apprenant un modèle génératif pour des motifs de mouvement réguliers, appelés régularité, en utilisant plusieurs sources avec très peu de supervision. Plus précisément, nous proposons deux méthodes qui reposent sur les autoencodeurs pour leur capacité à fonctionner avec peu ou pas de supervision. Nous tirons d'abord parti des caractéristiques locales spatio-temporelles conventionnelles et apprenons un autoencodeur complètement connecté sur celles-ci. Deuxièmement, nous construisons un autoencodeur entièrement convolutif et feed-forward pour apprendre à la fois les caractéristiques locales et les classificateurs dans le cadre d'un apprentissage de bout en bout. Notre modèle peut capturer les régularités de plusieurs ensembles de données. Nous évaluons nos méthodes de manière qualitative et quantitative - montrant la régularité apprise des vidéos sous divers aspects et démontrant des performances compétitives sur des ensembles de données de détection d'anomalies en tant qu'application.
Hasan et al. (ven.) ont étudié cette question.