Key points are not available for this paper at this time.
Wir präsentieren einen Ansatz zur robusten und genauen Schätzung der Handpose in Echtzeit aus bewegten egocentrischen RGB-D-Kameras in unordentlichen realen Umgebungen. Bestehende Methoden scheitern typischerweise bei Hand-Objekt-Interaktionen in unordentlichen Szenen, die aus egocentrischen Blickwinkeln aufgenommen wurden – ein gängiges Problem bei virtuellen oder erweiterten Realität Anwendungen. Unser Ansatz verwendet zwei nacheinander angewandte Convolutional Neural Networks (CNNs), um die Hand zu lokalisieren und 3D-Gelenkstandorte zu regressieren. Die Lokalisierung der Hand wird erreicht, indem ein CNN verwendet wird, um die 2D-Position des Handzentrums im Eingang zu schätzen, selbst in Gegenwart von Unordnung und Occlusion. Die lokalisierte Handposition, zusammen mit dem entsprechenden Eingabetiefenwert, wird verwendet, um ein normiertes beschnittenes Bild zu erzeugen, das in ein zweites CNN eingespeist wird, um relative 3D-Handgelenkstandorte in Echtzeit zu regressieren. Für zusätzliche Genauigkeit, Robustheit und zeitliche Stabilität verfeinern wir die Pose-Schätzungen mithilfe einer kinematischen Pose-Tracking-Energie. Zur Ausbildung der CNNs führen wir einen neuen photorealistischen Datensatz ein, der einen gemischten Realitätsansatz verwendet, um große Mengen an annotierten Daten über natürliche Handinteraktionen in unordentlichen Szenen zu erfassen und zu synthetisieren. Durch quantitative und qualitative Bewertungen zeigen wir, dass unsere Methode robust gegenüber Selbst-Occlusion und Occlusions durch Objekte ist, insbesondere in bewegten egocentrischen Perspektiven.
Mueller et al. (Sun,) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: