Key points are not available for this paper at this time.
توقع العمق من عرض واحد هو مشكلة أساسية في رؤية الكمبيوتر. مؤخرًا، أدت طرق التعلم العميق إلى تقدم كبير، لكن مثل هذه الطرق محدودة بالبيانات التدريبية المتاحة. تحتوي مجموعات البيانات الحالية المعتمدة على أجهزة الاستشعار ثلاثية الأبعاد على قيود رئيسية، بما في ذلك الصور الداخلية فقط (NYU)، وعدد قليل من أمثلة التدريب (Make3D)، والعينات المتناثرة (KITTI). نقترح استخدام مجموعات صور الإنترنت متعددة العرض، وهي مصدر بيانات virtually غير محدود، لتوليد بيانات التدريب من خلال طرق حديثة مثل الهيكل من الحركة والستيريو متعدد العرض (MVS)، ونقدم مجموعة بيانات عمق كبيرة تسمى ميغا عمق بناءً على هذه الفكرة. تأتي البيانات المستمدة من MVS مع تحدياتها الخاصة، بما في ذلك الضوضاء والأجسام التي لا يمكن إعادة بنائها. نتعامل مع هذه التحديات باستخدام طرق جديدة لتنظيف البيانات، بالإضافة إلى زيادة بياناتنا تلقائيًا باستخدام علاقات العمق الترتيبية التي تم إنشاؤها باستخدام تقسيم س semantic. نحن نتحقق من استخدام كميات كبيرة من بيانات الإنترنت من خلال إظهار أن النماذج المدربة على ميغا عمق تظهر تعميماً قوياً - ليس فقط للمشاهد الجديدة، ولكن أيضاً لمجموعات بيانات متنوعة أخرى بما في ذلك Make3D وKITTI وDIW، حتى عندما لم يتم رؤية أي صور من تلك المجموعات خلال التدريب.
درس لي وآخرون (الجمعة) هذا السؤال.
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: