Key points are not available for this paper at this time.
इस पेपर में, हम एक गहरे सुदृढीकरण सीखने-आधारित ढांचे का प्रस्ताव करते हैं जो एक रोबोट को अनदेखी वस्तुओं को यादृच्छिक स्थानों से लक्षित स्थान पर धकेलने के लिए अनुकूलनशील और निरंतर नियंत्रण सक्षम करता है। हमारा तरीका पुरस्कार function के डिजाइन में संपर्क जानकारी को ध्यान में रखता है, जिसके परिणामस्वरूप सफलता दरों में सुधार, अनदेखी वस्तुओं के लिए सामान्यीकरण, और संपर्क जानकारी पर विचार न करने वाली नीतियों की तुलना में कार्य दक्षता में वृद्धि होती है। केवल एक वस्तु का उपयोग करके सिमुलेशन में सुदृढीकरण सीखने के माध्यम से, हम एक वस्तु को संचालित करने के लिए एक सीखी गई नीति प्राप्त करते हैं, जो अनदेखी वस्तुओं को धकेलने के कार्य पर लागू करने पर अच्छा सामान्यीकरण प्रदर्शित करती है। अंततः, हम वास्तविक विश्व परिदृश्यों में अपने दृष्टिकोण की प्रभावशीलता को मान्य करते हैं।
वांग और अन्य (गुरुवार,) ने इस प्रश्न का अध्ययन किया।
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: