Key points are not available for this paper at this time.
تناقش هذه الورقة مشكلة تقدير وضع الإنسان الثلاثي الأبعاد في البرية. أحد التحديات الرئيسية هو نقص بيانات التدريب، أي الصور ثنائية الأبعاد للبشر المعلّمة بأوضاع ثلاثية الأبعاد. مثل هذه البيانات ضرورية لتدريب architectures CNN المتطورة. هنا، نقترح حلاً لتوليد مجموعة كبيرة من الصور التركيبية الفوتوواقعية للبشر مع تعليقات حول الأوضاع الثلاثية الأبعاد. نقدم محرك تركيب قائم على الصور يقوم بزيادة مجموعة البيانات الخاصة بالصور الحقيقية مع تعليقات حول أوضاع البشر الثنائية الأبعاد باستخدام بيانات Motion Capture الثلاثية الأبعاد (MoCap). بالنظر إلى وضع ثلاثي الأبعاد مرشح، يقوم الخوارزم لدينا باختيار صورة لكل مفصل تتطابق وضعها ثنائي الأبعاد محلياً مع الوضع الثلاثي الأبعاد المتوقّع. يتم دمج الصور المختارة بعد ذلك لتوليد صورة تركيبية جديدة عن طريق خياطة قطع الصور المحلية بطريقة مقيدة حركياً. تُستخدم الصور الناتجة لتدريب CNN من البداية إلى النهاية لتقدير وضع الجسم الكامل الثلاثي الأبعاد. نقوم بتجميع بيانات التدريب في عدد كبير من فئات الأوضاع ونتعامل مع تقدير الوضع كمشكلة تصنيف K-way. مثل هذا النهج قابل للتطبيق فقط مع مجموعات التدريب الكبيرة مثل مجموعتنا. تتفوق طريقتنا على ما هو موجود في الوقت الحالي من حيث تقدير الوضع الثلاثي الأبعاد في البيئات المسيطر عليها (Human3.6M) وتظهر نتائج واعدة للصور في البرية (LSP). هذا يثبت أن CNNs المدربة على الصور الاصطناعية تعمّم بشكل جيد على الصور الحقيقية.
درس روجيز وآخرون (2016) هذا السؤال.