Key points are not available for this paper at this time.
تم اقتراح عملية اتخاذ القرار ماركوف القابلة للملاحظة جزئياً (POMDP) كنموذج حوار يمكّن من التحسين التلقائي لسياسة الحوار ويوفر مرونة أمام أخطاء فهم الكلام. تتيح تقريبات مختلفة استخدام هذا النموذج لبناء أنظمة حوار حقيقية. ومع ذلك، يتطلب ذلك عددًا كبيرًا من الحوارات لتدريب سياسة الحوار، وبالتالي يعتمد عادة على توفر محاكي المستخدم. كما يتطلب الأمر جهدًا كبيرًا من المصممين لصياغة تمثيل السياسة يدويًا. نحن نستكشف استخدام العمليات الجاوسية (GPs) في نمذجة السياسة للتغلب على هذه المشكلات. نظهر أن تحسين سياسة GP يمكن تنفيذه لمدير حوار POMDP في العالم الحقيقي، وبشكل خاص: 1) نفحص صيغ مختلفة لسياسة GP لتقليل التباين في عملية التعلم؛ 2) نجد أن استخدام GP يزيد من معدل التعلم بمقدار ترتيب مما يسمح بالتعلم من خلال التفاعل المباشر مع المستخدمين البشريين؛ و 3) نظهر أن جهد المصمم يمكن تقليله بشكل كبير من خلال اعتماد السياسة مباشرة على فضاء الاعتقاد الكامل مما يتجنب نمذجة فضاء المميزات بشكل عشوائي. بشكل عام، يمثل نهج GP خطوة هامة نحو تحسين سياسة الحوار بشكل تلقائي بالكامل في أنظمة العالم الحقيقي.
دراسة غاسيك وآخرون (Mon,) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: