RT-2 от Google DeepMind, OpenVLA от Stanford-Toyota, GR00T от NVIDIA, LeRobot от Hugging Face и Pi-Zero от Physical Intelligence дают роботам возможность объединять визуальные данные, языковые команды и моторные действия в рамках единой модели. Эта возможность заменяет заранее прописанные последовательности шагов поведением типа «вижу — делаю», что обещает ускорение разработки и расширение доступа к робототехнике.

Почему важны модели «зрение-язык-действие»

На протяжении большей части истории робототехники инженеры писали явные скрипты, которые диктовали роботу каждое движение сустава. Новый класс моделей Vision-Language-Action (VLA) рассматривает робота как разговорного агента: камера транслирует изображение, пользователь произносит или печатает запрос, а модель выдает моторные команды, необходимые для его выполнения.

Пять ключевых моделей

  • RT-2 (Google DeepMind) — связывает необработанные визуальные потоки с человеческим языком, позволяя роботу описывать увиденное и действовать по голосовым инструкциям.
  • OpenVLA (Stanford + Toyota) — проект с открытым исходным кодом, который позволяет любому разработчику интегрировать модель в собственное оборудование.
  • GR00T (NVIDIA) — разработанная для гуманоидных платформ, она анализирует сцену и генерирует низкоуровневые моторные команды.
  • LeRobot (Hugging Face) — предоставляет репозиторий данных и набор инструментов, которые ускоряют обучение моделей и их интеграцию для разработчиков роботов.
  • Pi-Zero (Physical Intelligence) — утверждает, что единый «мозг» можно использовать в разных телах роботов, что упрощает программные стеки для различного оборудования.

Данные, симуляция и проблема дрейфа

Все пять моделей опираются на массивные наборы данных, большая часть которых получена в симулированных средах, поскольку сбор данных в реальном мире обходится дорого и сопряжен с рисками. Такая зависимость создает эффект «sim-to-real» дрейфа: поведение, изученное в идеальных виртуальных мирах, может давать сбои при столкновении с зашумленными датчиками, неравномерным освещением или неожиданными препятствиями.