Google DeepMind офіційно вступила в нову еру втіленого ШІ (embodied AI) із запуском Gemini Robotics 2 — передової моделі типу vision-language-action (VLA). Ця проривна технологія розроблена, щоб слугувати універсальним інтелектуальним шаром, що дозволяє роботам орієнтуватися у фізичному світі та взаємодіяти з ним на різних апаратних платформах.

Розквіт моделей Vision-Language-Action (VLA)

В основі цієї новини лежить перехід до складних VLA-моделей. На відміну від традиційного програмування робототехніки, яке покладається на жорсткі, заздалегідь визначені інструкції, Gemini Robotics 2 поєднує в собі розпізнавання зображень, обробку мови та керування діями в режимі реального часу. Така синергія дозволяє роботу не лише «бачити» об'єкт і «розуміти» вербальну команду, а й виконувати точні фізичні рухи, необхідні для взаємодії з цим об'єктом.

Нова архітектура DeepMind надзвичайно універсальна і розроблена для масштабування на різні форм-фактори. Модель здатна керувати чим завгодно: від спеціалізованих настільних роборук, що використовуються у виробництві, до складних антропоморфних роботів із повним тілом. Ця можливість вказує на майбутнє, де єдиний базовий інтелект можна буде переносити на різне обладнання, що значно знизить бар'єр для впровадження передової робототехніки в непередбачуваних середовищах.

Gemini Robotics ER 2: Розвиток втіленого міркування

Доповненням до VLA-моделі є представлення Gemini Robotics ER 2 — моделі, спеціально розробленої для «втіленого міркування» (embodied reasoning). У той час як VLA-моделі зосереджені на циклі сприйняття та дії, ER 2 фокусується на високорівневому процесі прийняття когнітивних рішень — розумінні фізичних нюансів середовища та визначенні оптимальної послідовності дій для досягнення мети.

Gemini Robotics ER 2 прийшла на зміну моделі Gemini Robotics ER 1.6, випущеній у квітні, що знаменує значний стрибок у можливостях міркування. Виступаючи як високорівнева система керування, ER 2 дозволяє роботам вийти за межі простих повторюваних завдань і перейти до складного вирішення проблем у реальних умовах. Для розробників, які бажають інтегрувати ці можливості, ER 2 вже доступна через Google AI Studio.

Чому це важливо для сфери ШІ

Розробка Gemini Robotics 2 є вирішальним кроком у прагненні до створення робототехніки загального призначення (General Purpose Robotics). Протягом багатьох років галузь боролася з «крихкістю» — схильністю роботів виходити з ладу при стикуванні з незначними змінами в навколишньому середовищі. Застосовуючи закони масштабування та логіку на основі трансформерів сімейства Gemini до фізичного руху, DeepMind працює над вирішенням проблеми адаптивності.

У разі успіху цей підхід «інтелектуального шару» може відокремити програмний інтелект від інженерії обладнання. Це дозволить значно прискорити впровадження робототехніки, оскільки розробники зможуть зосередитися на вдосконаленні фізичних актуаторів, покладаючись на надійні попередньо навчені моделі Google для обробки складної логіки руху та просторового міркування.

Основні висновки

  • Універсальна сумісність: Gemini Robotics 2 — це VLA-модель, здатна керувати різноманітним обладнанням, від компактних настільних маніпуляторів до складних гуманоїдних роботів.
  • Покращене міркування: Нова Gemini Robotics ER 2 забезпечує передове «втілене міркування», виступаючи як високорівневий когнітивний контролер для прийняття фізичних рішень.
  • Доступність для розробників: Google відкриває ці інструменти для екосистеми: ER 2 доступна в Google AI Studio, а ранній доступ до Gemini Robotics 2 можна отримати через список очікування.

Підсумок

Gemini Robotics 2 та супутній модуль ER 2 є конкретним кроком до створення універсального ШІ-мозку для роботів, що об'єднує сприйняття, мову та керування в єдину систему, яка піддається навчанню. Такий підхід може кардинально знизити вартість і складність розгортання складних роботів.