Modelos recientes de visión-lenguaje-acción (VLA) de alta capacidad han demostrado un rendimiento impresionante en una variedad de tareas de manipulación robótica al imitar demostraciones humanas. Sin embargo, aprovechar datos offline con un número limitado de estados visitados causará fallos en la ejecución en escenarios fuera de distribución. Intuitivamente, un método basado en la exploración que mejore los datos recopilados en línea en el momento de la prueba podría abordar esta limitación. Presentamos VLA-RL, un marco algorítmico y sistemático que aprovecha el aprendizaje por refuerzo (RL) en línea para mejorar los VLA auto-regresivos preentrenados en tareas posteriores. Desde una perspectiva unificada, primero introducimos una formulación de RL a nivel de trayectoria para el entrenamiento de VLA auto-regresivos, que modela la trayectoria de manipulación robótica general como una conversación multimodal de múltiples turnos. Para abordar el desafío de las recompensas escasas, ajustamos finamente un modelo de visión-lenguaje preentrenado como un modelo de recompensa de proceso robótico, que se entrena en etiquetas de recompensa pseudo anotadas en segmentos de tarea extraídos automáticamente. Para escalar, identificamos varias conclusiones de implementación que mejoran la estabilidad y eficiencia, incluyendo estrategia de selección curricular, entornos vectorizados equilibrados por GPU, decodificación en lotes y calentamiento del crítico. VLA-RL permite que OpenVLA-7B supere la base más fuerte ajustada fina en un 4.5% en 40 tareas desafiantes de manipulación robótica en LIBERO, e incluso iguala el rendimiento de modelos comerciales avanzados como ₀-FAST. Notablemente, observamos que VLA-RL se beneficia de una mayor optimización en el tiempo de prueba, lo que indica una chispa temprana de leyes de escalado de inferencia en robótica.
Lu et al. (2025) estudiaron esta pregunta.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: