Key points are not available for this paper at this time.
نعتبر مشكلة عصابة ذات ذراعين تتضمن أخذ عينات متتابعة من مجموعتين غير متجانستين. يتم تحديد الاستجابة في كل منهما بواسطة متجه عشوائي من المعاملات ومتجه من القيم غير المعروفة مسبقًا. الهدف هو تحقيق أقصى قدر من المكافآت المتوقعة التراكمية. ندرس هذه المشكلة في إطار الحد الأدنى للأقصى، ونطور سياسات مثلى من حيث السرعة تجمع بين الإجراءات قصيرة النظر بناءً على تقديرات المربعات الصغرى مع استراتيجية "أخذ عينات ملزمة" مناسبة. وقد تبين أن الندم ينمو لوغاريتميًا في أفق الزمن n ولا يمكن أن تحقق أي سياسة معدل نمو أبطأ على جميع حالات المشكلة القابلة للتطبيق. في هذا الإطار من عصابات الرد الخطي، تتغير هوية العمل الأقل مثالية مع قيم متجه المعاير، وتكون السياسة المثلى خاضعة للأخذ عينات من المجموعة الأدنى بمعدل ينمو كما هو موضح في الصيغة: انظر النص.
قام غولدنشلوجر وآخرون (سات،) بدراسة هذا السؤال.