Cortex 1.5: policy patching con RL interactivo para robótica real
Blog|

Cortex 1.5: policy patching con RL interactivo para robótica real

S
Sereact5 min de lectura
Cortex 1.5: Interactive RL Policy Patching

Desplegar modelos visión-lenguaje-acción (VLA) revela una limitación crítica: el desplazamiento de distribución entre un preentrenamiento estático y un mundo real dinámico. Ante configuraciones nuevas, incluso las políticas robustas presentan modos de fallo sistemáticos. Para superarlo, proponemos un cambio de paradigma inspirado en la inteligencia biológica. Las personas y los animales aprenden tanto por autoexploración como por interacción con maestros. Creemos que el futuro del aprendizaje robótico se asienta en los principios del autoaprendizaje y de la interacción con maestros humanos.

Aprender mediante la exploración

Presentamos Interactive RL Policy Patching, un marco distribuido que permite el autoaprendizaje a partir de recompensa humana y la actualización de políticas mediante breves intervenciones correctivas de personas. Para ello adaptamos el reinforcement learning off-policy en línea. Nuestro enfoque permite una adaptación rápida a nuevas condiciones de tarea preservando las habilidades ya adquiridas: el comportamiento de la política se alinea mejor con las preferencias humanas y requiere menos tiempo de exploración que los enfoques tradicionales.

Más allá del reentrenamiento: mejora continua mediante policy patching

Cuando una política muestra un comportamiento incorrecto, el enfoque habitual es recopilar más datos y reentrenar o ajustar ampliamente el modelo. Aunque eso puede corregir el fallo observado, resulta ineficiente: exige repetir ciclos completos de reentrenamiento y ejecución durante muchas rondas hasta observar todos los errores y cubrir bien todo el espacio estado-acción. En su lugar, tratamos la corrección de la política como una actualización ligera. Una breve guía humana muestra el comportamiento deseado en el estado de fallo, y esa información se incorpora después a la política mediante reinforcement learning. Así se pueden corregir de forma dirigida modos de fallo concretos sin reentrenar toda la política.

Interactive RL Policy Patching

Presentamos Interactive RL Policy Patching, un marco que integra la guía basada en demostraciones dentro del reinforcement learning para lograr una adaptación eficiente con mejor generalización.

1. Modelo fundacional

Nuestro modelo Cortex aporta un prior sólido, entrenado con cientos de millones de interacciones robóticas reales. Captura los principios generales del pick-and-place industrial pero, como cualquier modelo preentrenado, se topa con casos límite en los que la política aprendida no basta.

2. Demostración guiada por una persona

Cuando el robot falla en un escenario nuevo, un operador interviene por teleoperación y ofrece una breve demostración que resuelve ese caso de fallo concreto.

3. Ejecución interactiva con RL

En lugar de entrenar el modelo para minimizar el error de trayectoria frente a la demostración, usamos la aportación humana como guía para dar forma a una señal de recompensa destinada al reinforcement learning off-policy:

  • Patch: el operador demuestra el comportamiento correctivo.
  • Actualización de la política: actualizamos el modelo mediante reinforcement learning off-policy en línea.
  • Ejecución: el robot ejecuta la política actualizada en el entorno real.
  • Verificación: si la tarea tiene éxito, una recompensa positiva refuerza el nuevo comportamiento. (Actualmente esa recompensa la proporciona el operador debido a la alta complejidad de las tareas a las que nos enfrentamos; más abajo comentamos las líneas futuras.)

Figura 1: arquitectura general del sistema

Esta arquitectura crea un bucle de realimentación que evita la fase de exploración poco eficiente en muestras del RL puro y, al mismo tiempo, el reentrenamiento completo de la política.

Memoria de repetición

El entrenamiento se realiza en infraestructura de GPU centralizada, a partir de un replay buffer que agrega tres fuentes de datos:

  • Datos offline: un extracto de nuestros datos de manipulación industrial recogidos en más de 100 estaciones robóticas desplegadas, complementados con grabaciones de teleoperación humana. Proporcionan la distribución base para el preentrenamiento del modelo VLA.
  • Datos online: ejecuciones recogidas de forma continua de las políticas desplegadas en entornos de producción. Capturan el desplazamiento de distribución y la variabilidad del entorno que los datos offline por sí solos no pueden representar.
  • Datos de patch de comportamiento: episodios cortos y dirigidos en los que operadores humanos demuestran acciones correctivas en respuesta a los fallos observados.

Arquitectura actor-crítico

Usamos un marco actor-crítico para la optimización de la política. El actor genera las acciones y el crítico aprende el valor esperado de un par estado-acción. Este diseño permite actualizaciones rápidas de la política, ya que el actor puede incorporar comportamientos correctivos con relativamente pocos pasos de gradiente. Además, nos permite entrenar la cadena de extremo a extremo con señales directas del entorno, evitando la necesidad de un modelo de recompensa aprendido y complejo.

Sincronización distribuida de parámetros

Para propagar las mejoras por toda la flota desplegada mantenemos una cola de parámetros distribuida. El learner centralizado publica periódicamente los pesos actualizados de la política, que cada robot descarga de forma asíncrona. Cuando un operador aporta una demostración correctiva en una instalación, la actualización de política resultante queda disponible para toda la flota, amortizando el coste de cada intervención humana entre todos los despliegues.

Experimentos en el mundo real

Evaluamos Interactive RL Policy Patching en dos tareas de manipulación, comparándolo con nuestro Cortex VLA de referencia preentrenado con imitation learning. La primera es desembalar una caja de zapatos: el robot abre la caja, retira el papel de embalaje y coloca los zapatos en un contenedor aparte. La segunda consiste en clasificar tornillos en una caja de herramientas, y el robot debe colocar cada tornillo en el compartimento correcto del organizador.

Patch de la tarea de desembalaje de zapatos (patch de recogida del papel)

Patch de la tarea de desembalaje de zapatos (patch de recogida de la suela)

Patch de la tarea de clasificación de tornillos (patch de recogida)

Empíricamente, el policy patching apunta a una reducción tanto de las necesidades de datos como de la carga de cómputo. Como los errores suelen localizarse en puntos concretos de una trayectoria, recopilar episodios parciales permite correcciones más dirigidas que la recogida de episodios completos. Hemos observado que el patch interviene a la primera señal de fallo, acortando así la secuencia de acciones que el robot debe aprender. Eso simplifica el problema, porque se centra en la corrección inmediata en lugar de en una recuperación a largo plazo. Estas observaciones indican que el policy patching es una dirección prometedora para mejorar la robustez de las políticas con menos coste de datos.

Primeros resultados

Los primeros resultados indican que la principal limitación del Cortex VLA preentrenado con imitation learning no está en la ejecución nominal de la tarea, sino en su incapacidad para recuperarse de forma fiable y eficiente de estados de fallo raros o no vistos. El policy patching ataca directamente esas debilidades inyectando trayectorias de recuperación supervisadas por personas en los puntos de fallo, lo que permite a la política aprender un nuevo comportamiento con muy pocos datos adicionales. Como consecuencia, las mejoras en la tasa de éxito provienen sobre todo de una mayor capacidad de recuperación y no de una exploración más larga ni de un entrenamiento más prolongado. La menor duración de los episodios y la rápida adaptación sugieren además que el policy patching concentra el aprendizaje en las transiciones de estado de mayor impacto, lo que lo hace más eficiente y más robusto para el despliegue en el mundo real. Esto también reduce las barreras al entrenamiento en el mundo real. Los entornos reales no perdonan: los reinicios son lentos, el hardware es frágil y replicar un estado con exactitud (algo crucial para métodos como el RL en línea por pares) suele ser imposible. Al necesitar menos ejecuciones y menos horas de teleoperación para converger, nuestro método navega esas complejidades físicas de forma más segura y económica que los enfoques estándar.

Nuestra evaluación experimental se centra sobre todo en los compromisos entre el policy patching y el reentrenamiento completo de la política, y demuestra ventajas claras en eficiencia de datos y robustez del rendimiento. Para dar un contexto más amplio, también estamos comparando estos métodos con enfoques de autoexploración basados únicamente en reinforcement learning.

Efecto del policy patching en la duración de los episodios en distintas tareas

Figura 2: efecto del policy patching en la duración de los episodios en distintas tareas

Eficiencia de muestras de Interactive Policy Patching frente al reentrenamiento SFT completo

Figura 3: eficiencia de muestras de Interactive Policy Patching frente al reentrenamiento SFT completo

Próximos pasos

El policy patching permite correcciones dirigidas sin reentrenar políticas enteras. Al iniciar episodios desde estados de fallo concretos y aportar demostraciones focalizadas, podemos abordar modos de fallo con muy pocos datos y evitar el coste de ciclos completos de reentrenamiento. Además, nuestro método es un paso hacia el aprendizaje de flota en múltiples tareas y da lugar a políticas más orientadas a objetivos que las políticas de imitation learning puras.

Independientemente de cómo avancen los modelos fundacionales o los métodos de recogida de datos, la corrección de comportamiento eficiente en muestras seguirá siendo un reto central al desplegar sistemas robóticos a escala. Los enfoques de aprendizaje interactivo como el descrito aquí ofrecen una vía práctica hacia la mejora continua en flotas desplegadas, donde reentrenar desde cero suele ser inviable. Estamos deseando compartir resultados detallados en el próximo artículo.

Recursos del artículo

Acceda al contenido y los recursos de esta publicación

Contenido de texto

Copie el texto completo del artículo al portapapeles para leerlo o compartirlo fácilmente.

Recursos visuales

Descargue en un archivo ZIP todas las imágenes de alta resolución utilizadas en este artículo.

Últimos artículos