Key points are not available for this paper at this time.
Zusammenfassung: Multi-Agenten-Verstärkungslernen stützt sich auf Belohnungssignale, um die Politiknetzwerke einzelner Agenten zu leiten. In hochdimensionalen kontinuierlichen Räumen kann die nicht-stationäre Umgebung jedoch veraltete Erfahrungen liefern, die die Konvergenz behindern, was zu einer ineffektiven Trainingsleistung für Multi-Agenten-Systeme führt. Um dieses Problem zu lösen, wird ein neuartiges Verstärkungslernen-Schema, Mutual Information Oriented Deep Skill Chaining (MioDSC), vorgeschlagen, das eine optimierte kooperative Politik generiert, indem es intrinsische Belohnungen basierend auf gegenseitiger Information einbezieht, um die Erkundungseffizienz zu verbessern. Diese Belohnungen ermutigen Agenten, ihren Lernprozess zu diversifizieren, indem sie sich an Aktionen beteiligen, die die gegenseitige Information zwischen ihren Aktionen und dem Zustand der Umgebung erhöhen. Darüber hinaus kann MioDSC kooperative Politiken mithilfe des Optionsrahmens generieren, wodurch Agenten komplexe Aktionssequenzen lernen und wiederverwenden können, was die Konvergenzgeschwindigkeit des Multi-Agenten-Lernens beschleunigt. MioDSC wurde in der Multi-Agenten-Partikelumgebung und der StarCraft-Multi-Agenten-Herausforderung bei unterschiedlichen Schwierigkeitsgraden bewertet. Die experimentellen Ergebnisse zeigen, dass MioDSC die führenden Methoden übertrifft und in verschiedenen Multi-Agenten-Systemaufgaben mit hoher Stabilität robust ist.
Xie et al. (Thu,) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: