Key points are not available for this paper at this time.
本研究开发了一个基于强化学习的框架,用于动态管理元启发式中的大型搜索操作符组合。该框架利用禁忌搜索的理念,允许通过临时排除效率较低的操作符并在搜索过程中更新组合成分来进行持续适应。一个基于Q学习的自适应操作符选择机制用于在每个阶段从动态更新的组合中选择最合适的操作符。与传统方法不同,所提出的框架无需专家对搜索操作符的输入,使领域特定的非专家能够有效使用该框架。通过对置换流车间调度问题的应用,分析了所提出框架的性能。结果表明,所提出框架在最优性差距和收敛速度方面优于最先进的算法。
Mamaghan等人(周二)研究了这个问题。