다양한 로봇 형태에 걸쳐 지역 내비게이션 정책을 일반화하는 것은 중요한 도전 과제입니다. 비용이 많이 소모되는 구현 특정 데이터, 계획 및 제어의 긴밀한 결합, 결정론 모델이 다중 모드 결정을 포착하지 못하는 '재앙적 평균화' 문제로 인해 진전이 종종 저해됩니다 (예: 좌회전 또는 우회전). 우리는 구현 특정 동적 적응을 시스템적으로 분리하는 새로운 두 단계(IL-그 후-RL) 프레임워크인 CE-Nav를 소개합니다. 먼저, 우리는 모방 학습을 사용해 구현에 독립적인 일반 전문가를 오프라인으로 훈련합니다. 이 전문가, VelFlow라는 조건부 정규화 흐름 모델은 고전적인 계획자가 생성한 대규모 데이터셋에서 운동학적으로 유효한 행동의 전체 분포를 학습하여 실제 로봇 데이터는 완전히 피하며 다중 모드 문제를 해결합니다. 두 번째로, 새로운 로봇의 경우 우리는 전문가를 고정하고 이를 온라인 강화 학습을 통해 경량의 동적 인식 세분화를 훈련시키는 가이드 우선으로 사용합니다. 이 세분화기는 최소한의 환경 상호작용으로 목표 로봇의 특정 동적 및 제어 불완전성을 보상하는 방법을 빠르게 학습합니다. 네 발 짐승, 두 발 짐승, 쿼드로터에 대한 광범위한 실험은 CE-Nav가 최첨단 성능을 달성하면서 적응 비용을 획기적으로 줄인다는 것을 보여줍니다. 성공적인 실제 배치는 일반화 가능한 내비게이션 시스템을 구축하기 위한 효율적이고 확장 가능한 솔루션으로서 우리의 접근 방식을 추가로 검증합니다.
Yang et al. (Sat,)은 이 질문을 연구했습니다.