RT-2 de Google DeepMind, OpenVLA de Stanford-Toyota, GR00T de NVIDIA, LeRobot de Hugging Face y Pi-Zero de Physical Intelligence otorgan a los robots la capacidad de vincular la entrada visual, los comandos de lenguaje y las acciones motoras en un único modelo. Esa capacidad sustituye las secuencias de pasos codificadas a mano por un comportamiento de "ver y hacer", lo que promete un desarrollo más rápido y un acceso más amplio a la robótica.

Por qué es importante la visión-lenguaje-acción

Durante la mayor parte de la historia de la robótica, los ingenieros escribían guiones explícitos que indicaban a un robot cada movimiento de sus articulaciones. La nueva clase de modelos de Visión-Lenguaje-Acción (VLA) trata al robot como un agente conversacional: una cámara transmite una imagen, un usuario habla o escribe una solicitud y el modelo genera los comandos motores necesarios para cumplirla.

Los cinco modelos clave

  • RT-2 (Google DeepMind) – Conecta flujos visuales brutos con el lenguaje humano, permitiendo que un robot describa lo que ve y actúe según instrucciones habladas.
  • OpenVLA (Stanford + Toyota) – Un lanzamiento de código abierto que permite a cualquier desarrollador integrar el modelo en su propio hardware.
  • GR00T (NVIDIA) – Diseñado para plataformas humanoides, razona sobre la escena y genera comandos motores de bajo nivel.
  • LeRobot (Hugging Face) – Proporciona un repositorio de datos y un conjunto de herramientas que acelera el entrenamiento e integración de modelos para desarrolladores de robots.
  • Pi-Zero (Physical Intelligence) – Plantea que un único "cerebro" puede reutilizarse en diferentes cuerpos robóticos, simplificando las pilas de software para diversos tipos de hardware.

Datos, simulación y el problema de la deriva

Los cinco modelos se apoyan en conjuntos de datos masivos, la mayoría de los cuales provienen de entornos simulados porque la recopilación en el mundo real es costosa y riesgosa. Esa dependencia crea una deriva "sim-to-real": los comportamientos aprendidos en mundos virtuales perfectos pueden fallar al enfrentarse a sensores con ruido, iluminación desigual u obstáculos inesperados.