Key points are not available for this paper at this time.
最近のマルチエージェント深層強化学習(MDRL)に関する研究の急増は、複数の接続された自動化車両(CAV)が交差点を通過するための協調を促進する励みとなる方法を提供します。本論文では、価値分解に基づくMDRLアプローチ(QMIX)を適用し、異なる密度の混合自律交通において様々なCAVを制御し、燃料消費を公平に保ちながら信号無し交差点を効率的かつ安全に通過させることを目指します。ネットワークレベルの改善、TD()によるQ値の更新、および報酬クリッピング操作などの実装の工夫を純粋なQMIXフレームワークに追加し、収束速度と元のバージョンの漸近的性能を向上させることが期待されます。我々のアプローチの有効性はいくつかの評価指標によって示されます:平均速度、衝突数、およびエピソードあたりの平均燃料消費。実験結果は、我々のアプローチの収束速度と漸近的性能が、元のQMIXや非信号交差点に適用される最先端の強化学習ベースラインである近似政策最適化(PPO)を超えることができることを示しています。さらに、我々の手法によって制御される低交通量下のCAVは、衝突なしで平均速度を向上させ、最小限の燃料を消費することができます。学習報酬は収束し、交通密度が倍増する条件下でトレーニングも行われます。その結果、最大の報酬と最小の衝突を持つモデルは低燃料消費を保証し続けますが、車両の効率を若干低下させ、低交通量の相手よりも衝突を誘発することを示唆しており、より高度なシナリオへのRLポリシーの一般化の難しさを意味しています。
Guo et al.(金曜日)はこの問題を研究しました。