Key points are not available for this paper at this time.
في عالم غير مؤكد، غالبًا ما ينطوي اتخاذ القرار البشري على الاستفادة بشكل تكيفي من استراتيجيات مختلفة لتعظيم المكاسب. ومع ذلك، فإن هذه التحولات الاستراتيجية تُهمل من قبل العديد من نماذج التعلم المعزز التقليدية. هنا، نقوم بدمج أنظمة تقييم متوازية في النمذجة القائمة على التوزيع ونقترح نموذج عمليات مزدوجة مُثقل بالا_entropy يستفيد من توزيعات ديريشليه والتوزيعات الغاوسية المتعددة المتغيرات لتمثيل استراتيجيات اتخاذ القرار القائمة على التردد والقيمة، على التوالي. أظهرت محاكيات النموذج والاختبارات التجريبية أن نموذجنا تفوق على نماذج التعلم المعزز التقليدية من خلال التقاط التغيير الاستراتيجي للمشاركين بتميز من التعلم القائم على القيمة إلى التعلم القائم على التردد استجابةً لارتفاع عدم اليقين. مع زيادة تباين المكافآت، تحول المشاركون من التركيز على المكافآت الفعلية إلى استخدام تردد المكافآت كبديل للقيمة، مما أظهر تفضيلًا أكبر للخيارات التي تُكافأ بشكل متكرر ولكنها أقل في المكافأة. تشير هذه النتائج إلى أن زيادة عدم اليقين تشجع على الاستخدام التعويضي لطرق تقييم متنوعة، ويوفر نموذج العمليات المزدوجة لدينا إطارًا واعدًا لدراسة اتخاذ القرار متعدد الأنظمة في سياقات معقدة ومتعددة المتغيرات.
دراسة هو وآخرون (سون) هذا السؤال.