Key points are not available for this paper at this time.
協調的マルチエージェントシステムは、ネットワークパケットルーティングや自律走行車の調整など、多くの現実世界の問題を自然にモデル化するために使用できます。このようなシステムのために効率的に分散型ポリシーを学習できる新しい強化学習手法が求められています。その目的のために、反事実的マルチエージェント(COMA)ポリシーグラディエントという新しいマルチエージェントアクター・クリティック手法を提案します。COMAは中央集権的なクリティックを使用してQ関数の推定を行い、分散型のアクターでエージェントのポリシーを最適化します。さらに、マルチエージェントのクレジット割り当ての課題に対処するため、他のエージェントの行動を固定したまま、単一エージェントの行動をマージナル化する反事実的ベースラインを使用します。COMAはまた、反事実的ベースラインを効率的に単一のフォワードパスで計算できるクリティック表現を使用します。COMAを、部分的な観測可能性が大きい分散型のバリアントを用いたStarCraftユニットマイクロマネジメントのテストベッドで評価しました。この設定において、COMAは他のマルチエージェントアクター・クリティック手法に比べて平均的なパフォーマンスを大幅に向上させ、最も優れた性能を持つエージェントはフルステートにアクセスできる最先端の中央集権型コントローラーと競争力があります。
Foersterら(Wed,)はこの問題を研究しました。