Key points are not available for this paper at this time.
पॉवर इंटरनेट ऑफ थिंग्स (IoT) के निर्माण के साथ, शहरी वितरण नेटवर्क में स्मार्ट उपकरणों के बीच संचार धीरे-धीरे उच्च गति, उच्च संगतता और कम देरी की ओर बढ़ रहा है, जो शहरी वितरण नेटवर्क में पुनर्विन्यास अनुकूलन के लिए विश्वसनीय समर्थन प्रदान करता है। इस प्रकार, इस अध्ययन ने एक क्लाउड-एज सहयोग आर्किटेक्चर में शहरी वितरण नेटवर्क के लिए गहन सुदृढ़ीकरण सीखने पर आधारित बहु-स्तरीय गतिशील पुनर्विन्यास विधि का प्रस्तावित किया ताकि एक वास्तविक समय के अनुकूल बहु-स्तरीय गतिशील पुनर्विन्यास समाधान प्राप्त किया जा सके। पहले, बहु-स्तरीय गतिशील पुनर्विन्यास विधि पर चर्चा की गई, जिसमें फीडर-, ट्रांसफार्मर-, और सबस्टेशन-स्तरीय शामिल थे। इसके बाद, मल्टी-एजेंट सिस्टम को क्लाउड-एज सहयोग आर्किटेक्चर के साथ मिलाकर शहरी वितरण नेटवर्क में बहु-स्तरीय गतिशील पुनर्विन्यास के लिए एक गहन सुदृढ़ीकरण सीखने के मॉडल का निर्माण किया गया। क्लाउड-एज सहयोग आर्किटेक्चर प्रभावी ढंग से मल्टी-एजेंट सिस्टम का समर्थन कर सकता है ताकि "केंद्रित प्रशिक्षण और विकेंद्रीकृत कार्यान्वयन" ऑपरेशन मोड को संचालित किया जा सके और मॉडल की सीखने की दक्षता को बढ़ाया जा सके। इसके बाद, एक मल्टी-एजेंट सिस्टम के लिए, इस अध्ययन ने रणनीति के स्वचालित अनुकूलन और अद्यतन करने की क्षमता से मॉडल को संपन्न करने के लिए ऑफ़लाइन और ऑनलाइन सीखने का संयोजन अपनाया। ऑफ़लाइन शिक्षण चरण में, एक Q-लर्निंग आधारित मल्टी-एजेंट कंजर्वेटिव Q-लर्निंग (MACQL) एल्गोरिदम का प्रस्तावित किया गया ताकि शिक्षण परिणामों को स्थिर किया जा सके और अगले ऑनलाइन शिक्षण चरण के जोखिम को कम किया जा सके। ऑनलाइन शिक्षण चरण में, नीति ग्रेडिएंट पर आधारित मल्टी-एजेंट डीप डिटर्मिनिस्टिक पॉलिसी ग्रेडिएंट (MADDPG) एल्गोरिदम का प्रस्तावित किया गया ताकि क्रियाओं के स्थान की खोज की जा सके और अनुभव पूल को अद्यतन किया जा सके। अंत में, प्रस्तावित विधि की प्रभावशीलता को एक वास्तविक दुनिया के 445-नोड प्रणाली के सिमुलेशन विश्लेषण के माध्यम से सत्यापित किया गया।
जियांग एट अल। (बुध,) ने इस प्रश्न का अध्ययन किया।