Key points are not available for this paper at this time.
Cet article propose une nouvelle approche d'apprentissage par renforcement (RL) pour le transfert de politique sim-à-réal des véhicules aériens sans pilote à décollage et atterrissage verticaux (VTOL-UAV). L'approche proposée est conçue pour l'accostage des VTOL-UAV sur des stations d'amarrage offshore dans des opérations maritimes. Les VTOL-UAV dans les opérations maritimes rencontrent des limites dans leur portée opérationnelle, découlant principalement des contraintes imposées par leur capacité de batterie. Le concept d'atterrissage autonome sur une plateforme de recharge présente une perspective intrigante pour atténuer ces limitations en facilitant la recharge de la batterie et le transfert de données. Cependant, les méthodes actuelles d'apprentissage par renforcement profond (DRL) présentent des inconvénients, y compris des temps d'entraînement longs et des taux de succès modestes. Dans cet article, nous abordons ces préoccupations de manière exhaustive en décomposant la procédure d'atterrissage en une séquence de tâches plus gérables mais analogues en termes de phase d'approche et de phase d'atterrissage. L'architecture proposée utilise un schéma de contrôle basé sur un modèle pour la phase d'approche, où le VTOL-UAV se rapproche de la station d'amarrage offshore. Dans la phase d'atterrissage, des agents DRL ont été entraînés hors ligne pour apprendre la politique optimale pour accoster sur la station offshore. Le modèle de spectre Joint North Sea Wave Project (JONSWAP) a été utilisé pour créer un modèle d'onde pour chaque épisode, améliorant ainsi la généralisation de la politique pour le transfert sim2réel. Un ensemble d'algorithmes DRL a été testé à travers des simulations numériques incluant des agents basés sur la valeur et des agents basés sur la politique tels que Deep Q Networks (DQN) et Proximal Policy Optimization (PPO) respectivement. Les expériences numériques montrent que l'agent PPO peut apprendre des politiques compliquées et efficaces pour atterrir dans des environnements incertains, ce qui améliore à son tour la probabilité de transfert réussi sim-à-réal.
Ali et al. (Mer,) ont étudié cette question.