Los puntos clave no están disponibles para este artículo en este momento.
Si los robots generalistas van a operar en entornos verdaderamente no estructurados, necesitan ser capaces de reconocer y razonar sobre objetos y escenarios novedosos. Dichos objetos y escenarios pueden no estar presentes en los propios datos de entrenamiento del robot. Proponemos SuSIE, un método que aprovecha un modelo de difusión de edición de imágenes para actuar como un planificador de alto nivel al proponer subobjetivos intermedios que un controlador de bajo nivel puede alcanzar. Específicamente, afinamos InstructPix2Pix en datos de video, que consisten en videos de humanos y despliegues de robots, de tal manera que produzca observaciones hipotéticas futuras de "subobjetivo" dado la observación actual del robot y un comando en lenguaje. También utilizamos los datos del robot para entrenar una política condicionada por objetivos de bajo nivel para actuar como el mencionado controlador de bajo nivel. Encontramos que las predicciones de subobjetivos de alto nivel pueden utilizar preentrenamiento a escala de Internet y comprensión visual para guiar la política condicionada por objetivos de bajo nivel, logrando una generalización y precisión significativamente mejores que las políticas convencionales condicionadas por lenguaje. Logramos resultados de vanguardia en el benchmark CALVIN y también demostramos robusta generalización en tareas de manipulación del mundo real, superando líneas base fuertes que tienen acceso a información privilegiada o que utilizan órdenes de magnitud más computación y datos de entrenamiento. El sitio web del proyecto se puede encontrar en http://rail-berkeley.github.io/susie.
Black et al. (Mon,) estudiaron esta cuestión.