Google DeepMind 的 RT-2、斯坦福与丰田合作的 OpenVLA、NVIDIA 的 GR00T、Hugging Face 的 LeRobot 以及 Physical Intelligence 的 Pi-Zero 让机器人能够在单一模型中将视觉输入、语言指令和电机动作联系起来。这种能力用“见即行”(see-and-do)行为取代了手工编写的步骤序列,有望实现更快的开发速度并让机器人技术变得更加普及。
为什么视觉-语言-动作(VLA)如此重要
在机器人技术的大部分历史中,工程师们编写显式的脚本来告知机器人每个关节的运动。新型的视觉-语言-动作(VLA)模型将机器人视为一种对话代理:摄像头传输图像,用户通过语音或输入文字提出请求,模型随后输出完成该请求所需的电机指令。
当前备受关注的五种模型
- RT-2 (Google DeepMind) – 将原始视觉流与人类语言连接起来,使机器人能够描述所见内容并根据口头指令采取行动。
- OpenVLA (Stanford + Toyota) – 一个开源版本,允许任何开发者将该模型接入自己的硬件中。
- GR00T (NVIDIA) – 为人形机器人平台构建,能够对场景进行推理并生成底层电机指令。
- LeRobot (Hugging Face) – 为机器人开发者提供数据仓库和工具集,从而加速模型的训练与集成。
- Pi-Zero (Physical Intelligence) – 提出单一的“大脑”可以在不同的机器人躯体上重复使用,从而简化了针对不同硬件的软件栈。
数据、模拟与漂移问题
这五种模型都依赖海量数据集,其中大部分来自模拟环境,因为在现实世界中收集数据既昂贵又具有风险。这种依赖性产生了一种“从模拟到现实”(sim-to-real)的漂移:在完美的虚拟世界中习得的行为,在面对噪声传感器、不均匀光照或意外障碍物时可能会失效。
