Key points are not available for this paper at this time.
多智能体强化学习(MARL)方法通常面临高样本复杂性的问题,这限制了它们在数据稀缺或收集成本高的现实问题中的应用。尽管潜变量世界模型被用于通过生成大量合成数据来解决这个问题,但大多数模型无法将训练过程中可用的重要全局信息编码到其潜在状态中,从而妨碍了学习效率。少数例外模型虽然融入了全局信息,但假设集中的执行其学习的策略,这在许多具有部分可观察性的应用中是不切实际的。我们提出了一种新颖的基于模型的MARL算法MABL(多智能体双层世界模型),它从高维输入中学习双层潜变量世界模型。与现有模型不同,MABL能够在训练期间将关键信息编码到潜在状态中,同时保证学习策略的分散执行。对于每个智能体,MABL在上层学习一个全局潜在状态,并用于指导下层智能体潜在状态的学习。在执行过程中,智能体独立使用下层潜在状态进行动作。关键是,MABL可以与任何无模型的MARL算法结合用于策略学习。在我们的复杂离散和连续多智能体任务的实证评估中,包括SMAC、Flatland和MAMuJoCo,MABL在样本效率和整体性能上超越了SOTA多智能体潜变量世界模型。
Venugopal等人(星期三)研究了这个问题。