El área de investigación de optimización a dos niveles se ha vuelto cada vez más popular, en gran parte debido a su efectividad en el modelado y la resolución de problemas del mundo real. Este marco proporciona una estructura jerárquica que involucra a dos tomadores de decisiones (es decir, niveles superior e inferior) que gobiernan conjuntamente para encontrar una solución óptima a problemas complejos de optimización. La mayoría de los métodos de resolución propuestos en la literatura se adhieren a esta estructura jerárquica, lo que limita su aplicabilidad solo a instancias a pequeña escala del problema. Entre estas estrategias de resolución, destacamos un interesante algoritmo evolutivo conocido como CODBA, que se centra en descomponer el espacio de búsqueda del nivel inferior en varias partes que evolucionan en paralelo para abordar la alta complejidad de la estructura anidada. En este artículo, mejoramos las capacidades de búsqueda de CODBA al proponer un nuevo enfoque de aprendizaje por refuerzo evolutivo que integra el esquema central de CODBA con una estrategia de Q-learning, presentando un método prometedor para entrenar algoritmos de búsqueda inteligentes para problemas de optimización a dos niveles. Los experimentos estadísticos computacionales se realizan sobre el problema de enrutamiento de vehículos multi-depósito a dos niveles, demostrando la efectividad de nuestro enfoque en términos de tiempo de computación y calidad de solución en comparación con algoritmos existentes.
Abir Chaabani (Tue,) estudió esta cuestión.