RT-2 від Google DeepMind, OpenVLA від Stanford-Toyota, GR00T від NVIDIA, LeRobot від Hugging Face та Pi-Zero від Physical Intelligence надають роботам можливість поєднувати візуальні дані, мовні команди та моторні дії в межах єдиної моделі. Ця можливість замінює вручну закодовані послідовності кроків поведінкою за принципом «бачу і роблю», що обіцяє пришвидшення розробки та ширший доступ до робототехніки.
Чому vision-language-action має значення
Протягом більшої частини історії робототехніки інженери писали чіткі скрипти, які вказували роботу кожен рух суглоба. Новий клас моделей Vision-Language-Action (VLA) сприймає робота як розмовного агента: камера передає зображення, користувач озвучує або вводить запит, а модель видає моторні команди, необхідні для його виконання.
П'ять ключових моделей
- RT-2 (Google DeepMind) – поєднує необроблені візуальні потоки з людською мовою, дозволяючи роботу описувати те, що він бачить, і діяти за усними інструкціями.
- OpenVLA (Stanford + Toyota) – відкрите програмне забезпечення, яке дозволяє будь-якому розробнику інтегрувати модель у власне обладнання.
- GR00T (NVIDIA) – розроблена для гуманоїдних платформ, вона аналізує сцену та генерує низькорівневі моторні команди.
- LeRobot (Hugging Face) – надає репозиторій даних і набір інструментів, що пришвидшує навчання моделей та їх інтеграцію для розробників роботів.
- Pi-Zero (Physical Intelligence) – стверджує, що єдиний «мозок» можна повторно використовувати для різних тіл роботів, що спрощує програмні стеки для різноманітного обладнання.
Дані, симуляція та проблема дрейфу
Усі п'ять моделей спираються на величезні набори даних, більшість із яких отримано в симуляційних середовищах, оскільки збір даних у реальному світі є дорогим і ризикованим. Така залежність створює «sim-to-real» дрейф: поведінка, вивчена в ідеальних віртуальних світах, може дати збій при зіткненні з шумами сенсорів, нерівномірним освітленням або непередбачуваними перешкодами.
