Key points are not available for this paper at this time.
多智能体强化学习(MARL)在代理数量增加时面临关键挑战,包括信用分配和维度灾难。在合作环境中,对代理的统一处理往往会加剧这些问题。我们认为,代理的重要性取决于其个性化属性和环境状态,并提出在关键代理上集中计算资源,而其他代理则采取简单的行为,从而缓解维度爆炸并改善泛化能力。我们提出了非同步框架决策(DNF),该框架在每个时间步识别和优先考虑关键代理,以优化决策,同时根据计算结果为剩余代理分配预定义或简化的行为。为实现这一点,我们引入了核心提取器(CE)架构,将代理分类为优先关键代理(PKAs)和跟随者。尽管代理按优先级进行区分,我们仍遵循集中训练与分散执行(CTDE)范式。这种方法降低了联合状态-动作空间的维度,缓解了MARL中的维度爆炸问题,并促进了代理之间的更好合作。实验结果表明,DNF在多个SMAC地图上实现了100%的胜率,包括3m、2s3z和1c3s5z,并在2cᵥs₆4zg和走廊等困难和超困难场景中达到了98.9–100%的胜率,明显优于QMIX和QPLEX等基线方法,既在最终性能上,也在训练稳定性上,同时计算开销仅略有增加。在连续的MPE中,DNF在性能上与HAPPO相当或更优,且显示出显著更高的时间效率,随着代理数量的增加,这些优势愈加明显。
谢等(周五)研究了这个问题。