Google DeepMind 随着 Gemini Robotics 2(一种尖端的视觉-语言-动作 (VLA) 模型)的发布,正式开启了具身智能 (embodied AI) 的新时代。这项突破性技术旨在作为一个通用的智能层,使机器人能够在各种不同的硬件平台上进行导航并与物理世界进行交互。

视觉-语言-动作 (VLA) 模型的兴起

这次发布的核心在于向复杂的 VLA 模型转型。与依赖于僵化、预定义指令的传统机器人编程不同,Gemini Robotics 2 集成了图像识别、语言处理和实时动作控制。这种协同作用使机器人不仅能够“看到”物体并“理解”口头指令,还能执行与该物体交互所需的精确物理动作。

DeepMind 的新架构具有极高的通用性,旨在扩展到各种形态。该模型能够控制从制造业中使用的专用桌面机械臂到复杂的全身人形机器人等各种设备。这种能力预示着一个未来:单一的基础智能可以移植到不同的硬件上,从而显著降低在不可预测的环境中部署先进机器人的门槛。

Gemini Robotics ER 2:推进具身推理

与 VLA 模型相辅相成的是 Gemini Robotics ER 2 的推出,这是一种专门为“具身推理 (embodied reasoning)”设计的模型。虽然 VLA 模型侧重于感知与动作的循环,但 ER 2 则侧重于高层认知决策过程——即理解环境的物理细微差别,并确定实现目标的最优动作序列。

Gemini Robotics ER 2 是 4 月发布的 Gemini Robotics ER 1.6 模型的继任者,标志着推理能力的重大飞跃。通过充当高层控制系统,ER 2 使机器人能够超越简单的重复性任务,转向在现实世界场景中解决复杂问题。对于希望集成这些能力的开发者,ER 2 已可通过 Google AI Studio 获取。

为什么这对 AI 领域至关重要

Gemini Robotics 2 的开发代表了追求通用机器人 (General Purpose Robotics) 进程中的关键一步。多年来,业界一直受困于“脆弱性 (brittleness)”——即机器人在面对环境的轻微变化时容易失效的倾向。通过将 Gemini 系列的缩放定律 (scaling laws) 和基于 Transformer 的逻辑应用于物理运动,DeepMind 正致力于解决适应性问题。

如果成功,这种“智能层”方法可以将软件智能与硬件工程解耦。这将极大地加速机器人的部署,因为开发者可以专注于改进物理执行器,同时依靠 Google 强大的预训练模型来处理运动和空间推理的复杂逻辑。

核心要点

  • 通用兼容性: Gemini Robotics 2 是一种 VLA 模型,能够控制从紧凑型桌面机械臂到复杂人形机器人的各种硬件。
  • 增强的推理能力: 新的 Gemini Robotics ER 2 提供先进的“具身推理”,充当物理决策的高层认知控制器。
  • 开发者的可访问性: Google 正在向生态系统开放这些工具,ER 2 已可在 Google AI Studio 中使用,而 Gemini Robotics 2 的早期访问可通过候补名单获取。

总结

Gemini Robotics 2 及其配套的 ER 2 模块代表了迈向机器人通用 AI 大脑的坚实一步,将感知、语言和控制整合进一个单一的可训练系统中。这种方法可能会大幅降低部署复杂机器人的成本和复杂性。