Key points are not available for this paper at this time.
في هذه الورقة، نقدم خوارزمية جديدة للتعلم المعزز (RL) للتحكم في حركة الروبوت، وهي استراتيجية تعلم تدرّج السياسة الحتمي العميق (DDPG) مع القيود لمساعدة الروبوتات الثنائية القائم في المشي بأمان وبدقة. أكدت الأبحاث السابقة عن هذا الموضوع على القيود في قدرة وحدة التحكم على تتبع موضع القدم بدقة على الأراضي المنفصلة وغياب الاعتبار لمخاوف السلامة. في هذه الدراسة، نتناول هذه التحديات من خلال تركيزنا على ضمان سلامة النظام العام. لنبدأ، نقوم بمعالجة مشكلة الديناميكا العكسية من خلال تقديم قيود لطريقة المربعات الصغرى المدمجة. هذه التحسينات لا تعالج فقط مشكلات التفرد، بل تضمن أيضًا نطاقات آمنة لزوايا المفاصل، مما يضمن استقرار وموثوقية النظام. بناءً على ذلك، نقترح اعتماد طريقة DDPG المقيدة لتصحيح انحرافات وحدة التحكم. في DDPG المقيدة، نقوم بإدخال طبقة قيود إلى شبكة الممثل، مدمجين انحرافات المفاصل كمدخلات حالة. من خلال إجراء تدريب غير متصل ضمن نطاق الزوايا الآمنة، يعمل كمصحح للانحراف. أخيرًا، نثبت فعالية نهجنا المقترح من خلال إجراء محاكاة ديناميكية باستخدام الروبوت الثنائي القائم CRANE. من خلال تقييمات شاملة، بما في ذلك تحليل التفرد، وتقييم فعالية القيود، وتجارب المشي على الأراضي المنفصلة، نظهر تفوق وملاءمة نهجنا في تعزيز أداء المشي مع ضمان السلامة. بشكل عام، تساهم أبحاثنا في تقدم حركة الروبوتات الثنائية القائم من خلال معالجة تحسين المشي من عدة وجهات نظر، بما في ذلك معالجة التفرد، وقيود السلامة، وتعلم الانحراف.
درس ليو وزملاؤه (الثلاثاء) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: