Key points are not available for this paper at this time.
Die kollaborative Suche von Multi-Unbemannten Luftfahrzeugen (Multi-UAS) stellt eine hochmoderne Forschungsrichtung im Bereich der Anwendungen unbemannter Luftfahrzeuge dar. Der Einsatz von Multi-UAS-Systemen zur Zielsuche in niedrig fliegenden und zur Überwachung von Gebieten hat sich als effektives Mittel zur Verbesserung der Sicherheitsfähigkeiten entwickelt. In praktischen Szenarien verlassen sich UAS auf Bord-Sensoren, um Umgebungsinformationen zu erfassen; jedoch sind die Beobachtungsfähigkeiten dieser Sensoren aufgrund ihrer begrenzten Wahrnehmungsreichweite von Natur aus lokal und eingeschränkt. Dieses Papier untersucht das Problem der kollaborativen Suche von Multi-UAS in teilweise beobachtbaren niedrig-altitude Umgebungen, in denen jeder UAS einen kreisförmigen Sensorbereich mit einem endlichen Radius besitzt. Informationen über den Standort eines Ziels werden nur erlangt, wenn ein Ziel in das Sichtfeld eines UAS eintritt. Das Ziel besteht darin, eine kollaborative Suche zu erreichen und eine kontinuierliche Überwachung aufrechtzuerhalten, während die Sicherheit zwischen UAS und mit der Umwelt gewährleistet wird. Um diese Herausforderung zu bewältigen, schlagen wir einen neuartigen Multi-Agenten Deep Reinforcement Learning (MADRL)-Algorithmus vor, der als Normalizing Graph Attention Soft Actor-Critic (NGASAC) bezeichnet wird. Dieser Algorithmus integriert eine Normalisierungsfluss (NL)-Schicht und ein Multi-Head-Graph-Attention-Netzwerk (MHGAT). Die Technik des Normalisierungsflusses wandelt traditionelle Gaussian-Sampling in eine komplexere Aktionsverteilung um, wodurch die Ausdruckskraft und Flexibilität der Politik erhöht wird. Gleichzeitig verbessert der Algorithmus, indem er ein Multi-Head-Graph-Attention-Netzwerk konstruiert, das die Beziehungen zwischen „Hindernis-Ziel“ erfasst, die Fähigkeit der UAS, komplexe räumliche Topologien zu lernen und zu verstehen, was zu deutlich besseren Leistungen bei der kollaborativen Suche und stabilen Überwachung versteckter Ziele führt. Simulationsergebnisse zeigen, dass der NGASAC-Algorithmus die Basismethoden erheblich übertrifft, wie zum Beispiel Multi-Agent Soft Actor-Critic (MASAC), Multi-Agent Proximal Policy Optimization (MAPPO) und Multi-Agent Deep Deterministic Policy Gradient (MADDPG) über mehrere Bewertungsmetriken hinweg, einschließlich Erfolgsquote, Aufgabenzeit und Hindernisvermeidungskapazität. Darüber hinaus zeigt er starke Generalisierungsleistung und Robustheit.
Yang et al. (Thu,) untersuchten diese Frage.