Key points are not available for this paper at this time.
多智能体路径规划(MAPF)对大规模机器人系统至关重要。最近的方法已应用强化学习(RL)学习部分可观察环境中的分散策略。获得无碰撞策略的基本挑战在于,智能体需要学习合作以应对拥堵情况。本文将通信与深度Q学习相结合,提供了一种用于MAPF的新型基于学习的方法,其中智能体通过图卷积实现合作。为了指导RL算法在长期目标导向任务上的表现,我们将从单一源点的最短路径的潜在选择作为启发式指导,而不是像大多数现有工作那样使用特定路径。我们的方法独立处理每个智能体,并从单个智能体的角度训练模型。最终训练的策略应用于每个智能体进行分散执行。整个系统在训练过程中是分布式的,并且在课程学习策略下进行训练。在障碍物丰富的环境中的实证评估表明,我们的方法具有高成功率和低平均步数。
马等人(Mon,)研究了这个问题。