Key points are not available for this paper at this time.
本論文では、カリキュラム学習を活用した近接ポリシー最適化アルゴリズム(PPO)を用いて、モバイルロボットの最短経路を見つける方法を提案します。Webotsシミュレーターを使用して3D空間で環境をモデル化することで、8つのIRセンサーからの連続状態を処理し、E-puckロボットの2つのモーターの速度を制御するPPOアルゴリズムの能力を拡張します。本研究は、複雑な環境での適応能力とトレーニング効率を向上させることを目的に、独自にカリキュラム学習をPPOフレームワークに統合しています。修正されたPPO、元のPPO、深層決定的政策勾配アルゴリズムの比較分析を行い、当社のアプローチの強みを強調しています。結果は、カリキュラム強化PPOアルゴリズムがトレーニングプロセスを加速するだけでなく、新しい環境においても優れた適応力と一般化を示すことを示しています。この研究は、深層強化学習アルゴリズムのロバストかつ効率的なロボットナビゲーション性能を向上させるためのカリキュラム学習の重要な可能性を強調しています。
Iskandar et al. (Mon,) はこの問題を研究しました。