Key points are not available for this paper at this time.
在协作人机订单拣选系统中,人类拣货员和自主移动机器人(AMRs)在仓库中独立移动,并在拣货地点会合,拣货员将物品装载到AMRs上。本文考虑了这样一个优化问题,即在随机环境中将拣货员分配给AMRs。我们提出了一种新颖的多目标深度强化学习(DRL)方法,旨在学习有效的分配政策,以最大化拣货效率,同时改善人类拣货员之间的工作负载公平性。我们的方法使用图模型化仓库状态,并定义一种神经网络架构,以捕捉区域信息并有效提取与效率及工作负载相关的表示。我们开发了一个离散事件模拟模型,用于训练和评估所提出的DRL方法。在实验中,我们证明了我们的方法能够找到非支配政策集,明确了公平和效率目标之间的良好权衡。经过训练的政策在效率和公平性方面均优于基准表现。此外,当在不同仓库规模的场景中测试时,它们显示出良好的可迁移性。模拟模型的实现、所提方法和实验已发表。
Smit等人(星期二)研究了这个问题。