Key points are not available for this paper at this time.
Handlungen in realen Anwendungen finden typischerweise in unordentlichen Umgebungen mit großen Variationen in der Orientierung und der Skalierung des Akteurs statt. Wir präsentieren einen Ansatz, um bekannte Handlungen gleichzeitig zu verfolgen und zu erkennen, der robust gegenüber solchen Variationen ist und von einer Personenerkennung in der stehenden Pose ausgeht. In unserem Ansatz rendern wir zunächst synthetische Posen aus mehreren Blickwinkeln mit Hilfe von Mocap-Daten für bekannte Handlungen und repräsentieren sie in einem bedingten Zufallsfeld (CRF), dessen Beobachtungspotenziale mit Hilfe von Formähnlichkeit berechnet werden und dessen Übergangspotenziale mithilfe von optischem Fluss berechnet werden. Wir erweitern diese grundlegenden Potenziale mit Termen zur Darstellung räumlicher und zeitlicher Einschränkungen und nennen unser erweitertes Modell das Shape-Flow-Dauer-bedingte Zufallsfeld (SFD-CRF). Wir finden die beste Sequenz von Handlungen mittels Viterbi-Suche im SFD-CRF. Wir demonstrieren unseren Ansatz an Videos aus mehreren Blickwinkeln und in Anwesenheit von Hintergrundgeräuschen.
Natarajan et al. (Sun,) haben diese Frage untersucht.