Este trabajo estudia el problema de la toma de decisiones colaborativas en tareas para vehículos submarinos autónomos (AUV) en condiciones de observabilidad parcial. Ante las limitaciones de las capacidades de toma de decisiones autónomas insuficientes durante tareas colaborativas de múltiples AUV, se propone un marco de aprendizaje por refuerzo profundo de múltiples agentes (MADRL) basado en el algoritmo de gradiente de política determinista profunda de múltiples agentes (MADDPG). La implementación del marco de entrenamiento centralizado con ejecución distribuida (CTDE) permite que cada AUV tome información global como entrada durante la fase de entrenamiento y genere acciones basadas únicamente en su propia red de política durante la fase de ejecución. Esto permite que cada AUV tome decisiones de manera independiente basándose en sus observaciones locales tras el entrenamiento, minimizando la necesidad de comunicación continua y mejorando así la capacidad de toma de decisiones autónomas descentralizadas del sistema. Además, se diseña un proceso de decisión de Markov parcialmente observable (POMDP) para entornos marinos desconocidos, permitiendo la planificación de rutas parcialmente observable para múltiples AUV. Los resultados de simulaciones demuestran que el enfoque propuesto puede lograr la evasión autónoma de obstáculos y la asignación de objetivos en escenarios de múltiples AUV. El método de toma de decisiones propuesto mejora la seguridad colaborativa y facilita el desarrollo de operaciones de misiones marítimas.
Yu et al. (Wed,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: