Google DeepMind официально вступила в новую эру воплощенного ИИ (embodied AI) с запуском Gemini Robotics 2 — передовой модели типа «зрение-язык-действие» (VLA). Эта прорывная технология призвана стать универсальным интеллектуальным слоем, позволяющим роботам ориентироваться в физическом мире и взаимодействовать с ним на различных аппаратных платформах.
Расцвет моделей Vision-Language-Action (VLA)
В основе этого анонса лежит переход к сложным VLA-моделям. В отличие от традиционного программирования робототехники, опирающегося на жесткие, заранее определенные инструкции, Gemini Robotics 2 объединяет в себе распознавание изображений, обработку языка и управление действиями в режиме реального времени. Такая синергия позволяет роботу не только «видеть» объект и «понимать» голосовую команду, но и выполнять точные физические движения, необходимые для взаимодействия с этим объектом.
Новая архитектура DeepMind отличается исключительной универсальностью и способна масштабироваться под различные форм-факторы. Модель может управлять всем: от специализированных настольных манипуляторов, используемых в производстве, до сложных полноразмерных гуманоидных роботов. Эта возможность указывает на будущее, в котором единый базовый интеллект можно будет переносить на различное оборудование, что значительно снизит порог внедрения передовой робототехники в непредсказуемых условиях.
Gemini Robotics ER 2: Развитие воплощенного рассуждения (Embodied Reasoning)
Дополнением к VLA-модели является внедрение Gemini Robotics ER 2 — модели, специально разработанной для «воплощенного рассуждения» (embodied reasoning). В то время как VLA-модели сосредоточены на цикле восприятия и действия, ER 2 фокусируется на высокоуровневом процессе принятия когнитивных решений — понимании физических нюансов окружающей среды и определении оптимальной последовательности действий для достижения цели.
Gemini Robotics ER 2 пришла на смену модели Gemini Robotics ER 1.6, выпущенной в апреле, что ознаменовало значительный скачок в возможностях рассуждения. Выступая в роли высокоуровневой системы управления, ER 2 позволяет роботам выйти за рамки простых повторяющихся задач и перейти к решению сложных проблем в реальных условиях. Разработчики, желающие интегрировать эти возможности, уже могут получить доступ к ER 2 через Google AI Studio.
Почему это важно для ландшафта ИИ
Разработка Gemini Robotics 2 представляет собой важнейший шаг на пути к созданию робототехники общего назначения (General Purpose Robotics). На протяжении многих лет отрасль боролась с «хрупкостью» — склонностью роботов давать сбой при малейших изменениях в окружающей среде. Применяя законы масштабирования и логику трансформеров семейства Gemini к физическим движениям, DeepMind работает над решением проблемы адаптивности.
В случае успеха такой подход с «интеллектуальным слоем» позволит отделить программный интеллект от проектирования оборудования. Это обеспечит колоссальное ускорение внедрения робототехники, поскольку разработчики смогут сосредоточиться на совершенствовании физических приводов, полагаясь на надежные предварительно обученные модели Google для обработки сложной логики движения и пространственного мышления.
Основные выводы
- Универсальная совместимость: Gemini Robotics 2 — это VLA-модель, способная управлять различным оборудованием: от компактных настольных манипуляторов до сложных гуманоидных роботов.
- Улучшенное рассуждение: Новая Gemini Robotics ER 2 обеспечивает продвинутое «воплощенное рассуждение», выступая в роли высокоуровневого когнитивного контроллера для принятия физических решений.
- Доступность для разработчиков: Google открывает эти инструменты для экосистемы: ER 2 доступна в Google AI Studio, а ранний доступ к Gemini Robotics 2 можно получить через список ожидания.
Итог
Gemini Robotics 2 и сопутствующий модуль ER 2 представляют собой реальный шаг к созданию универсального ИИ-мозга для роботов, объединяющего восприятие, язык и управление в единую обучаемую систему. Такой подход может радикально снизить стоимость и сложность развертывания высокотехнологичных роботов.
