Key points are not available for this paper at this time.
في هذا العمل، نناقش طريقة لدمج المعرفة الميدانية في بيئة التعلم المعزز (RL) من خلال عملية استنساخ السلوك، في سياق نظام إدارة الطاقة الحضرية. يتم استخدام المعرفة السابقة، المرمزة في برامج قائمة على القواعدheuristic، لتهيئة شبكة السياسة لوكيل التعلم المعزز، وبعد ذلك يتم استخدام خوارزمية التعلم المعزز لتحسين ذلك من خلال التحسين ضد وظيفة المكافأة. يتم تنفيذ الأفكار الرئيسية في إطار CityLearn، حيث يتم استخدام وحدة التحكم الناتجة لإدارة تخزين الطاقة الكهربائية لخمس مبانٍ في منطقة ما. نوضح أن الوكلاء الناتجين يوفرون مكاسب أداء قابلة للقياس مقارنة بالأسس الحالية، حيث يقدمون تحسيناً بنسبة 3.8% مقارنة بوحدة التحكم القائمة على القواعد الأساسية، وتحسيناً بنسبة 20% مقارنة بوحدة تحكم مبنية على التعلم المعزز فقط. كما نوضح إمكانية استخدام التعلم بالتقليد لتطوير وكلاء بخصائص مرغوبة دون تشكيل مكافأة صريح.
درس كومار وآخرون (الأربعاء) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: