Key points are not available for this paper at this time.
Apresentamos uma abordagem unificada baseada em modelo e orientada a dados para planejamento e controle quadrupedal, visando alcançar locomoção dinâmica em terrenos irregulares. Utilizamos feedback proprioceptivo e exteroceptivo a bordo para mapear informações sensoriais e comandos de velocidade base desejados em planos de passos usando uma política de aprendizado por reforço (RL). Esta política de RL é treinada em simulação em uma ampla variedade de terrenos gerados proceduralmente. Quando executado online, o sistema acompanha os planos de passos gerados usando um controlador de movimento baseado em modelo. Avaliamos a robustez de nosso método em uma ampla variedade de terrenos complexos. Ele exibe comportamentos que priorizam estabilidade em vez de locomoção agressiva. Além disso, introduzimos duas políticas de RL auxiliares para rastreamento de movimento corretivo de corpo inteiro e controle de recuperação. Essas políticas consideram mudanças em parâmetros físicos e perturbações externas. Treinamos e avaliamos nossa estrutura em um sistema quadrupedal complexo, a versão B do ANYmal, e demonstramos a transferibilidade para um robô maior e mais pesado, o ANYmal C, sem a necessidade de re-treinamento.
Gangapurwala et al. (Sex,) estudaram esta questão.