Key points are not available for this paper at this time.
강화 학습(RL) 알고리즘이 연속적인 의사결정 문제에서 뛰어난 성능을 발휘함에 따라 최근 몇 년 동안 다중 에이전트 협업 제어 분야의 연구자들 사이에서 인기를 끌고 있습니다. 그러나 강화 학습 알고리즘의 반복 과정에서 발생하는 부트스트래핑 및 극대화 과정으로 인한 과대 추정 문제는 실제 공간에서 연속 행동 공간을 가진 다중 에이전트 시스템에서의 강화 학습 방법의 적용을 제한합니다. 과대 추정 문제를 완화하기 위해, 우리는 타겟 네트워크를 추가하고 비평가 네트워크를 클리핑하여 과대 추정을 완화하고 우세 기능을 도입하여 알고리즘의 안정성을 향상시키는 우월한 클리핑 비평가 네트워크 RL 알고리즘을 제안합니다. 설계된 알고리즘은 pybullet 물리 엔진을 기반으로 하는 다중 UAV 협업 환경에서 검증되었습니다. 우리는 총 세 가지 다중 UAV 협업 패러다임을 설계하였고, 설계된 알고리즘의 성능을 PPO 및 DDPG 알고리즘과 비교하였습니다. 실험 결과, 설계된 알고리즘은 각각 26.67%, 13.35%, 47.09% 향상되었으며, 세 가지 서로 다른 협력 작업에서 두 가지 비교 알고리즘에 비해 최종 평균 누적 보상에서 각각 23.37%, 7.34%, 13.05% 향상되었습니다.
Zhang et al. (금요일) 이 질문을 연구하였습니다.