Key points are not available for this paper at this time.
لقد كانت خوارزميات التعلم المعزز (RL) موجودة منذ عقود وقد استخدمت لحل مجموعة متنوعة من مشاكل صنع القرار المتسلسل. ومع ذلك، واجهت هذه الخوارزميات تحديات كبيرة عند التعامل مع بيئات عالية الأبعاد. لقد مكنت التطورات الأخيرة في التعلم العميق أساليب RL من دفع السياسات المثلى للوكلاء المتطورين والقادرين، الذين يمكنهم الأداء بكفاءة في هذه البيئات الصعبة. تتناول هذه المقالة جانبًا مهمًا من التعلم العميق المعزز يتعلق بالsituations التي تتطلب من عدة عملاء التواصل والتعاون لحل المهام المعقدة. يتم تقديم مسح لطرق مختلفة لمشاكل متعلقة بالتعلم العميق المعزز متعدد العملاء (MADRL)، بما في ذلك عدم الاستقرارية، وقابلية الملاحظة الجزئية، والفضاء المستمر للحالة والإجراء، ونظم تدريب متعددة العملاء، والتعلم المتنقل متعدد العملاء. سيتم تحليل ومناقشة مزايا وعيوب الأساليب المراجعة مع استكشاف التطبيقات المقابلة لها. يُتوقع أن تقدم هذه المراجعة رؤى حول طرق MADRL المختلفة ويمكن أن تؤدي إلى تطوير مستقبلي لطرق تعلم متعددة العملاء أكثر قوة وفائدة لحل مشاكل العالم الحقيقي.
درس نجوين وآخرون (2020) هذا السؤال.
Synapse has enriched 2 closely related papers on similar clinical questions. Consider them for comparative context: