역 강화 학습(IRA)은 전문가의 시연을 설명하기 위해 보상 함수를 학습합니다. 현대의 IRA 방법들은 보상 최적화와 정책 최적화를 번갈아 가며 수행하는 적대적(극소화극대화) 형식을 자주 사용하는데, 이는 불안정한 훈련으로 이어질 수 있습니다. 최근의 비적대적 IRA 접근법은 에너지 기반 형식을 통해 보상과 정책을 함께 학습함으로써 안정성을 개선하지만, 정식 보장은 부족합니다. 본 연구는 이 간극을 메웁니다. 우리는 먼저 정규 비적대적 방법들이 전문가 행동의 가능성을 명시적 또는 암시적으로 최대화한다는 통합된 관점을 제시하며, 이는 기대 수익 격차를 최소화하는 것과 동등합니다. 이 통찰은 우리의 주요 기여인 신뢰 지역 보상 최적화(TRRO)로 이어지며, 이는 소수화-극대화 과정을 통해 이 가능성을 단조롭게 개선할 것을 보장하는 프레임워크입니다. 우리는 TRRO를 인접 역 보상 최적화(PIRO)로 구체화하여 실용적이고 안정적인 IRA 알고리즘을 제시합니다. 이론적으로 TRRO는 전방 강화 학습에서 신뢰 지역 정책 최적화(TRPO)의 안정성 보장에 대한 IRA 대응 체계를 제공합니다. 실증적으로 PIRO는 보상 회복에서 최첨단 기준을 일치시키거나 초과하며, MuJoCo와 Gym-Robotics 벤치마크 및 실제 동물 행동 모델링 작업에서 샘플 효율성이 높은 정책 모방을 보여줍니다.
Chen et al. (2025)는 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: