Key points are not available for this paper at this time.
इस पेपर में, हम एक ऑनलाइन समकालिक लगभग ऑप्टिमल लर्निंग एल्गोरिदम विकसित करते हैं जो नीति पुनरावृत्ति पर आधारित है ताकि एक मल्टीप्लययर नॉन-जीरो-सम गेम को बिना गतिशील सिस्टम के सटीक ज्ञान की आवश्यकता के हल किया जा सके। पहले, हम साबित करते हैं कि नॉन-जीरो-सम गेम के लिए ऑनलाइन नीति पुनरावृत्ति एल्गोरिदम गणितीय रूप से बानच स्पेस में क्वाज़ी-न्यूटन की पुनरावृत्ति के समान है। फिर, एक मॉडल न्यूरल नेटवर्क स्थापित किया जाता है जो अज्ञात निरंतर-समय गैर-रेखीय सिस्टम की पहचान करने के लिए इनपुट-आउटपुट डेटा का उपयोग करता है। प्रत्येक खिलाड़ी के लिए, एक आलोचक न्यूरल नेटवर्क और एक क्रियाशील न्यूरल नेटवर्क का उपयोग उसकी मूल्य कार्य और नियंत्रण नीति के अनुकरण के लिए किया जाता है। हमारा एल्गोरिदम केवल आलोचक न्यूरल नेटवर्क के भार को समायोजित करने की आवश्यकता है, इसलिए सीखने की प्रक्रिया के दौरान गणनात्मक जटिलता कम होगी। सभी न्यूरल नेटवर्क के भार ऑनलाइन, वास्तविक समय में, निरंतर और समकालिक रूप से अपडेट होते हैं। इसके अलावा, लयापुनोव दृष्टिकोण के आधार पर बंद-लूप सिस्टम की सामान्य अंतिम बाउंडेड स्थिरता का प्रमाण दिया गया है। अंत में, विकसित योजना की प्रभावशीलता को दर्शाने के लिए दो सिमुलेशन उदाहरण दिए गए हैं।
लियू एट अल। (शुक्रवार,) ने इस प्रश्न का अध्ययन किया।