Key points are not available for this paper at this time.
يتعلق التحكم التنبؤي الموزع بالنموذج (DMPC) بكيفية التحكم بشكل فعال في أنظمة الروبوتات المتعددة على الإنترنت مع القيود. ومع ذلك، فإن اللاخطية، وعدم الإقليدية، والارتباطات القوية لنماذج الأنظمة الديناميكية والقيود يمكن أن تجعل تنفيذ DMPC في الوقت الحقيقي وفي العالم الحقيقي غير بسيط. تعتبر خوارزميات تعلم التعزيز (RL) واعدة لتصميم سياسات التحكم. ومع ذلك، فإن كيفية ضمان السلامة من حيث قيود الحالة في التعلم المعزز لا تزال قضية مهمة. تقترح هذه الورقة خوارزمية تعلم تعزيز آمن مستندة إلى وظيفة حاجز لـ DMPC للأنظمة متعددة الروبوتات غير الخطية تحت قيود الحالة. يتكون الاقتراح المقدم من عدة منظمات MPC قائمة على التعلم المحلي. كل منظم، المرتبط بنظام محلي، يتعلم وينشر سياسة التحكم المحلية باستخدام خوارزمية تعلم تعزيز آمنة بطريقة موزعة، أي، مع معلومات الحالة فقط بين الوكلاء الجيران. كميزة بارزة للخوارزمية المقترحة، نقدم هيكل سياسة جديد قائم على الحاجز لضمان السلامة، والذي له تفسير ميكانيكي واضح. تبين التجارب المحاكاة والتجارب الواقعية على التحكم في تشكيل الروبوتات المتحركة مع تجنب التصادم فعالية خوارزمية تعلم التعزيز الآمن المقترحة لـ DMPC.
قام زانغ وآخرون (مون) بدراسة هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: