摘要 随着客户期望的提高和计算能力的增强,许多运输、制造和生产运营在随机动态环境中面临着实时决策。决策者必须寻找并调整复杂的计划,这些计划不仅在当前有效,而且对未来的发展也具有灵活性。在高维受限决策空间中搜索有效且灵活的决策所面临的挑战体现在 Bellman equation 的三个组成部分中:奖励函数、价值函数和决策空间。在文献中,强化学习(RL)已展现出快速评估有限数量决策的奖励和价值函数的潜力,但在搜索大多数规划问题中存在的受限决策空间时却面临困难。如何将复杂决策空间的彻底搜索与 RL 评估技术相结合的问题仍未解决。我们提出了两种基于 RL 的求解方法,并详细阐述了第三种方法,以集成的方式搜索和评估决策。每种方法的灵感均来自 Bellman equation 的一个组成部分。前两种方法动态地塑造奖励函数或决策空间,以鼓励有效且灵活的决策或阻止不灵活的决策。第三种方法将 Bellman equation 建模为混合整数线性规划公式,其中价值函数由神经网络近似。我们在针对精心设计的问题类别进行的结构化分析中比较了我们提出的求解方法。与著名的基准方法相比,我们证明了本方法的有效性,并强调了这些方法的性能不仅取决于问题类别,还取决于实例的参数化。
Hildebrandt et al. (Wed,) 对这一问题进行了研究。