Key points are not available for this paper at this time.
대부분의 심층 강화 학습 알고리즘은 복잡하고 풍부한 환경에서 데이터 비효율적이며, 이는 많은 시나리오에서의 적용성을 제한합니다. 데이터 효율성을 개선하기 위한 한 방향은 관련 작업 간의 전이를 통해 효율성을 향상시킬 수 있는 공유 신경망 매개변수를 이용한 다중 작업 학습입니다. 그러나 실제로는 서로 다른 작업에서의 기울기가 부정적인 상호작용을 하여 학습을 불안정하게 만들고, 때때로 데이터 효율성을 떨어뜨리기 때문에 이러한 현상이 보이지 않습니다. 또 다른 문제는 작업 간의 보상 체계가 달라서 하나의 작업이 공유 모델의 학습을 지배하게 되는 것입니다. 우리는 여러 작업의 공동 훈련을 위한 새로운 접근 방식을 제안하며, 이를 Distral(증류 및 전이 학습)이라고 부릅니다. 서로 다른 작업 간의 매개변수를 공유하는 대신, 우리는 작업 간의 공통 행동을 포착하는 '증류'된 정책을 공유할 것을 제안합니다. 각 작업자는 공유 정책에 가깝게 유지되도록 제약을 받으면서 자신의 작업을 해결하도록 훈련되며, 공유 정책은 모든 작업 정책의 중심점이 되도록 증류에 의해 훈련됩니다. 학습 과정의 두 가지 측면은 공동 목적 함수를 최적화하여 유도됩니다. 우리는 우리 접근 방식이 복잡한 3D 환경에서 효율적인 전이를 지원하며, 여러 관련 방법보다 더 뛰어난 성능을 발휘함을 보여줍니다. 게다가, 제안된 학습 과정은 더 강력하고 더 안정적이며, 이는 심층 강화 학습에 있어 매우 중요한 속성입니다.
Teh et al. (Thu,)은 이 질문을 연구했습니다.