Key points are not available for this paper at this time.
ندرس عملية صنع القرار الماركوفية المحدودة المقعرة، حيث يكون الهدف هو تقليل وظيفة مقعرة لمقياس الزيارة، مع مراعاة قيد مقعر. يواجه تصميم خوارزميات لعملية MDP المقعرة المحدودة عدة تحديات، بما في ذلك (1) التعامل مع مساحة الحالة الكبيرة، (2) إدارة توازن الاستكشاف/الاستغلال، و(3) حل تحسين مقيّد حيث تكون الهدف والقيد كلاهما دوال غير خطية لمقياس الزيارة. في هذا العمل، نقدم خوارزمية قائمة على النموذج، تحسين السياسة الأولية والثنائية المتغير (VPDPO)، حيث يتم تنفيذ ازدواجية لاجرانج وفينشيل لإعادة صياغة المشكلة المقيدة الأصلية إلى تحسين أولي-ثنائي غير مقيد. علاوة على ذلك، يتم تحديث المتغيرات الأولية من خلال تكرار القيمة القائم على النموذج وفقاً لمبدأ التفاؤل في مواجهة عدم اليقين (OFU)، بينما يتم تحديث المتغيرات الثنائية عن طريق صعود التدرج. علاوة على ذلك، من خلال تضمين مقياس الزيارة في مساحة ذات أبعاد نهائية، يمكننا التعامل مع مساحات الحالة الكبيرة عن طريق دمج تقريب الدالة. مثالان ملحوظان هما (1) المنظمات غير الخطية المعتمدة على النواة و(2) عمليات MDP ذات الرتبة المنخفضة. نحن proof أن مع وجود مسبار تخطيط متفائل، تحقق خوارزميتنا تندراً تحت خطي وانتهاكاً للقيد في كلا الحالتين ويمكنها الوصول إلى السياسة المثلى العالمية للمشكلة المقيدة الأصلية.
دراسة لي وزملائه (الجمعة) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: