Key points are not available for this paper at this time.
في التعلم المعزز (RL)، من المعروف أن أخطاء تقريب الدالة تؤدي بسهولة إلى مبالغات في قيمة Q، مما يقلل بشكل كبير من أداء السياسة. تقدم هذه المقالة خوارزمية الممثل الناعم النقدي الموزع (DSAC)، وهي طريقة تعلم معزز خارج السياسة لبيئة التحكم المستمر، لتحسين أداء السياسة من خلال التخفيف من مبالغات قيمة Q. أولاً، نكتشف نظريًا أن تعلم دالة التوزيع لعوائد الحالة-الإجراء يمكن أن يخفف بشكل فعال من مبالغات قيمة Q لأنها قادرة على تعديل حجم خطوة التحديث لدالة قيمة Q بشكل تكيفي. ثم، تم تطوير إطار عمل التكرار الناعم الموزع للسياسة (DSPI) من خلال تضمين دالة توزيع العوائد في تعلم التعزيز الأقصى للكبر. أخيرًا، نقدم نسخة عميقة من الممثل النقدي خارج السياسة لـ DSPI، تُسمى DSAC، والتي تتعلم مباشرةً توزيع العوائد المستمر من خلال إبقاء تباين عوائد الحالة-الإجراء ضمن نطاق معقول للتصدي لمشاكل التدرجات المتفجرة والغامرة. نقيم DSAC على مجموعة مهام التحكم المستمر MuJoCo، محققين أداءً على مستوى الدولة من الفن.
دوان وآخرون (الأربعاء) درسوا هذا السؤال.
Synapse has enriched 2 closely related papers on similar clinical questions. Consider them for comparative context: