Los puntos clave no están disponibles para este artículo en este momento.
Diseñar agentes generalizables capaces de adaptarse a diversas encarnaciones ha logrado una atención significativa en el Aprendizaje por Refuerzo (RL), que es crítico para desplegar agentes de RL en diversas aplicaciones del mundo real. Los enfoques previos de RL Inter-Embodiment se han centrado en transferir conocimiento entre encarnaciones dentro de tareas específicas. Estos métodos a menudo resultan en un conocimiento estrechamente vinculado a esas tareas y no capturan adecuadamente las características distintas de diferentes encarnaciones. Para abordar esta limitación, introducimos la noción de Aprendizaje por Refuerzo No Supervisado Inter-Embodiment (CEURL), que aprovecha el aprendizaje no supervisado para permitir que los agentes adquieran conocimiento consciente de la encarnación y agnóstico a la tarea a través de interacciones en línea dentro de entornos sin recompensas. Formulamos CEURL como un novedoso Proceso de Decisión de Markov de Encarnación Controlada (CE-MDP) y analizamos sistemáticamente los objetivos de pre-entrenamiento de CEURL bajo CE-MDP. Basado en estos análisis, desarrollamos un nuevo algoritmo de Control Consciente de la Encarnación Pre-entrenado (PEAC) para manejar CEURL, incorporando una función de recompensa intrínseca diseñada específicamente para el pre-entrenamiento inter-embodiment. PEAC no solo proporciona una estrategia de optimización intuitiva para el pre-entrenamiento inter-embodiment, sino que también puede integrarse de manera flexible con los métodos existentes de RL no supervisados, facilitando la exploración inter-embodiment y el descubrimiento de habilidades. Experimentaciones exhaustivas en entornos simulados (por ejemplo, DMC y Robosuite) y del mundo real (por ejemplo, locomoción con patas) demuestran que PEAC mejora significativamente el rendimiento de adaptación y la generalización inter-embodiment, demostrando su efectividad para superar los desafíos únicos de CEURL.
Ying et al. (miércoles) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: