قدمت التقدمات الأخيرة في التعلم العميق المعزز القابل للتفسير (DRL) رؤى حول الأسباب وراء القرارات التي يتخذها وكلاء DRL. ومع ذلك، غالبًا ما تغفل الأساليب الحالية الطبيعة الذاتية للتفسيرات و تفشل في أخذ أساليب التفسير والتفضيلات المعرفية البشرية بعين الاعتبار. تميل هذه الجهل إلى تقليل إمكانية تفسير وملاءمة التفسيرات الناتجة من منظور المقيم البشري. لمعالجة هذه القضية، نقدم الإدراك البشري في إجراء الشرح من خلال دمج DRL مع توجيه الانتباه بطريقة جديدة. يتعلم مفهوم تحسين السياسة القريب (Concept-PPO) إنشاء تفسيرات متماشية مع البشر من خلال تحسين أداء DRL والفجوة بين التفسيرات الناتجة والتعليقات البشرية بشكل متزامن. العنصر الرئيسي هو محول المفهوم المكاني المصمم خصيصًا الذي يمكنه تحسين كفاءة الشرح عن طريق تصفية المعلومات غير ذات الصلة بالقرار. تظهر التجارب على معيار ATARI أن Concept-PPO يحقق سياسات أفضل من نظرائه غير الشفافين، وتؤكد الدراسات التي أجراها المستخدمون تفوقه في إنشاء تفسيرات متماشية مع البشر مقارنة بأساليب DRL القابلة للتفسير الحالية.
درس جي وآخرون (Mon,) هذا السؤال.