Key points are not available for this paper at this time.
강화 학습(RL)의 낮은 샘플 효율성과 모방 학습(IL)에서 고품질 시연 요구는 실제 로봇 적용을 저해합니다. 이러한 문제를 해결하기 위해 작업 지향 자기 모방 학습(TOSIL)이라는 새로운 자기 진화 프레임워크가 제안됩니다. 외부 시연을 우회하기 위해 에피소드별 탐험과 장기 보상 관점에서 자체 생성된 상위 K개의 궤적을 전문가 데이터로 선정합니다. 각 전이는 이러한 궤적으로부터 공식화된 가이드 보상을 할당받으며, 에이전트가 진화함에 따라 가이드 보상이 업데이트되어 우수한 탐험 행동을 장려합니다. 이 방법론은 에이전트가 과제와 관련된 방향으로 탐험하도록 보장하여 샘플 효율성과 점근적 성능을 향상시킵니다. 이동과 조작 작업에 대한 실험 결과는 제안된 프레임워크가 다른 최첨단 RL 방법을 능가함을 보여줍니다. 또한, 최적이 아닌 궤적 통합은 성능을 유지하면서 샘플 효율을 향상할 잠재력을 지닙니다. 이는 로봇의 자율 기술 습득에 있어 중요한 진전입니다.
Ran 등(수요일)은 이 문제를 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: