摘要 动态障碍规避仍然是机器人手臂运动规划中的一个关键挑战,因为传统算法难以在非结构化环境中平衡自适应决策与精确轨迹生成。我们提出了一种分层运动规划框架,结合了近端策略优化(PPO)和快速探索随机树星(RRT*),并使用课程学习范式进行训练。PPO通过逐渐困难的训练场景学习全局障碍规避策略,而RRT*则优化局部轨迹,以弥补PPO在精细运动控制方面的局限。多目标奖励函数——结合步骤效率项和人工势场原则——通过量身定制的惩罚和奖励平衡探索与利用。在动态障碍场景中,所提出的方法实现了87.6%的成功率,优于单独的PPO和现有的混合强化学习方法。该框架为动态障碍规避提供了一种实用解决方案,广泛适用于高维自主操作任务。
Ma等(Sun,)研究了这个问题。