Key points are not available for this paper at this time.
基于预训练范式的离线多智能体强化学习(MARL),利用大量轨迹进行离线预训练和在线部署,最近变得非常流行。在多种任务上表现良好的传统基于模仿学习的预训练决策模型通常需要大量的专家轨迹或示范,这限制了多智能体情况下预训练策略的发展。为了解决这个问题,我们提出了一种新设置,其中多智能体策略使用次优(非专家)数据进行离线预训练,然后在线测试,期望获得高回报。在这个受对比学习启发的实际设置中,我们提出了YANHUI,这是一个简单而有效的框架,利用精心设计的奖励对比函数,从包含各种奖励水平数据的数据集中进行多智能体策略表示学习,而不仅仅依赖专家轨迹。此外,我们通过专家混合丰富多智能体策略的预训练,以动态地进行表示。在相同数量的离线星际争霸多智能体挑战数据集上,YANHUI在离线MARL基准之上取得了显著改进。尤其是,我们的方法在性能上与早期的最先进的方案令人惊讶地竞争,尽管仅使用其他基线10%的专家数据,其余由劣质数据替代。
孟等(Mon,)研究了这个问题。