Key points are not available for this paper at this time.
تطور هذه الورقة خوارزميات لمشكلات التحكم العشوائي عالية الأبعاد بناءً على التعلم العميق والبرمجة الديناميكية. على عكس أساليب البرمجة الديناميكية التقريبية الكلاسيكية، نقوم أولاً بتقريب السياسة المثلى بواسطة الشبكات العصبية في روح التعلم المعزز العميق، ثم تقريب دالة القيمة بواسطة الانحدار مونت كارلو. يتم تحقيق ذلك في تكرار البرمجة الديناميكية من خلال الأداء أو التكرار الهجين، والطرق الانحدارية الحالية من الاحتمالات العددية. نقدم مبررات نظرية لهذه الخوارزميات. يتم تحليل تناسق وسرعة التقارب لتقديرات التحكم ودالة القيمة والتعبير عنها من حيث خطأ التقريب العالمي للشبكات العصبية، وخطأ الإحصاء عند تقدير دالة الشبكة، مع ترك جانباً خطأ التحسين. يتم تقديم نتائج عددية حول تطبيقات متنوعة في ورقة مرافقة (arxiv.org/abs/1812.05916) وتوضح أداء الخوارزميات المقترحة.
درس هوري وآخرون (الجمعة) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: