Key points are not available for this paper at this time.
Técnicas de aprendizado por reforço (RL) têm sido estudadas para resolver o problema de equilíbrio entre demanda e capacidade (DCB) na gestão do tráfego aéreo para explorar seu pleno potencial computacional. Devido à falta de generalização e ao aparentemente reduzido desempenho de otimização afetado pelos cenários de treinamento, é desafiador para os métodos de DCB baseados em RL existentes serem aplicados de forma eficaz na prática. Este artigo propõe um método geral de aprendizado por reforço multiagente (MARL) que integra uma estratégia de prioridade de atraso baseada em heurística para melhorar a eficiência da solução e a generalização do modelo. A estratégia de prioridade de atraso é utilizada para reduzir a tarefa de aprendizado potencial e, assim, a dificuldade de treinamento. Este estudo explora quais características da estratégia de prioridade de atraso são mais adequadas ao método MARL. Uma rede de memória de longo curto prazo (LSTM) é integrada a uma rede de aprendizado Q profundo (DQN) para garantir que o modelo seja compatível com instâncias arbitrárias de DCB e para facilitar a identificação de setores-chave pelos agentes. Este estudo é realizado como parte de um grande projeto de pesquisa europeu de DCB, onde dados reais do espaço aéreo francês e espanhol são utilizados para experimentação. Os resultados sugerem que o método proposto apresenta vantagens em generalização, desempenho de otimização e desempenho computacional em relação aos métodos de DCB baseados em RL de última geração.
Chen et al. (Qui,) estudaram esta questão.
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: