本文重新考察了海因里希·F·冯·斯塔克尔贝格对不完全信息下领导者-跟随者博弈的原始描述,探讨了学习动态如何塑造战略互动。领导者反复更新对跟随者反应函数的猜测,然后选择一个最大化其收益的活动水平。反过来,跟随者对每个活动水平作出最优反应,提供信息以供领导者用来完善其猜测。在假设线性猜测、类似Jean-Marie和Tidball 2006的平滑更新过程以及二次收益函数的基础上,我们确定了学习过程收敛到自确认稳态的特定条件。我们在两个典型环境中描述了活动水平和收益:顺序伙伴关系博弈和数量竞争的顺序双头垄断博弈。随后我们将学习结果与(完全信息)斯塔克尔贝格解和卡特尔解进行了比较。在这一过程中,我们发现缺乏信息和随之而来的战略模糊性导致更高的联合收益的条件,以及传统对第一行动者优势的直觉需要在这些情境中进行修正。
Claude等(周五)研究了这个问题。