Key points are not available for this paper at this time.
Methoden des Multi-Agenten-Verstärkenden Lernens (MARL) leiden oft unter hoher Stichprobenkomplexität, was ihre Anwendung in realen Problemen einschränkt, bei denen Daten rar oder kostspielig zu sammeln sind. Obwohl latente variable Weltmodelle eingesetzt wurden, um dieses Problem zu adressieren, indem sie reichlich synthetische Daten für das MARL-Training generieren, können die meisten dieser Modelle keine wichtigen globalen Informationen, die während des Trainings verfügbar sind, in ihren latenten Zuständen kodieren, was die Lern-Effizienz beeinträchtigt. Die wenigen Ausnahmen, die globale Informationen integrieren, gehen von einer zentralisierten Ausführung ihrer gelernten Politiken aus, was in vielen Anwendungen mit partieller Beobachtbarkeit unpraktisch ist. Wir schlagen einen neuartigen modellbasierten MARL-Algorithmus vor, MABL (Multi-Agent Bi-Level-Weltmodell), der ein bi-level latentes Variablen-Weltmodell aus hochdimensionalen Eingaben lernt. Im Gegensatz zu bestehenden Modellen ist MABL in der Lage, essentielle globale Informationen während des Trainings in den latenten Zuständen zu kodieren, während die dezentrale Ausführung der gelernten Politiken garantiert wird. Für jeden Agenten lernt MABL einen globalen latenten Zustand auf der oberen Ebene, der verwendet wird, um das Lernen eines latenten Zustands des Agenten auf der unteren Ebene zu informieren. Während der Ausführung verwenden die Agenten ausschließlich Zustände der unteren Ebene und handeln unabhängig. Entscheidend ist, dass MABL mit jedem modellfreien MARL-Algorithmus zum Lernen von Politiken kombiniert werden kann. In unserer empirischen Bewertung mit komplexen diskreten und kontinuierlichen Multi-Agenten-Aufgaben, einschließlich SMAC, Flatland und MAMuJoCo, übertrifft MABL die SOTA Multi-Agenten-latenten Variablen-Weltmodelle sowohl in der Stichprobeneffizienz als auch in der Gesamtleistung.
Venugopal et al. (Mi,) haben diese Frage untersucht.