物理 AI 的前沿正面临巨大的瓶颈:我们缺乏高保真、真实世界的训练数据。大语言模型通过抓取互联网文本实现增长;而机器人技术则需要一种成本高得多的方法。
机器人技术中的数据稀缺问题
为了让类人机器人和仓储机器人达到人类般的灵活性,它们需要目前尚不存在的数据规模。Encord 的机器人学习负责人、OpenAI 机器人实验室资深专家 Vineeth Velmurugan 表示,实现突破需要一个规模约为 YouTube 整个视频库五倍的数据集。
文本资源丰富且抓取成本极低。而物理数据必须经过“制造”。仅靠视频进行训练往往无法提供复杂操作所需的高保真度。因此,行业重心已从调整模型架构转向解决更难的问题:制造高质量、带标注的物理数据。
超越视频:利用脑电波和肌肉信号
像 Encord 这样的初创公司正在测试新的数据模态,以赋予机器人更深层的上下文信息。在与德国神经科学初创公司 Zander Labs 进行的一项试点项目中,Encord 为操作员配备了脑电波耳机。通过测量神经活动,研究人员希望能够推断出意图、错误和惊讶感。
Zander 的神经科学家 Lucas Gehrke 表示,通过追踪大脑活动,模型构建者可以准确知道机器人应该在何时针对困难任务调用其最强大的计算模型。
Encord 还探索了:
- 肌电图 (EMG): 绑在小臂上的传感器可以捕捉肌肉中的电信号,从而创建手部动作的三维图谱,而头戴式摄像头往往会遗漏这些信息。
- 主从装置 (Leader-Follower Rigs): 配对的机械臂,其中一个模仿人类操作员,捕捉诸如倒液体或堆叠扑克筹码等精确动作。
- 密集标注 (Dense Annotation): 例如“右手拧紧螺栓”之类的标签。Velmurugan 估计,对于训练特定任务而言,这种密集标注的价值比原始的第一视角视频高出 100 倍。
物理 AI 的经济现实
从“数字优先”的 AI 转向物理 AI,彻底改变了机器学习的经济模式。LLM 实验室通过从网络抓取数据,以接近于零的边际成本构建模型。而生产机器人训练数据则需要硬件、人工操作和精细的标注。Encord 的目标是使高质量数据的成本效益达到其交付价值的 20 倍,但即便如此,对于大型机器人集群而言,这仍意味着数百万美元的项目投入。
率先生成海量、丰富标注数据集的公司将主导自主操作领域——从插上网线到物品的拣选和包装。而那些固守仅靠视频的流水线的公司,则面临着被竞争对手超越的风险,因为后者正在从人体和大脑中获取更丰富的信号。
核心要点
- 数据制造 vs. 数据采集: 与抓取现有互联网数据的 LLM 不同,物理 AI 需要昂贵且人工化的、高保真数据集的“制造”。
- 神经模态: 引入脑电波和 EMG 让机器人能够比仅靠视频更有效地理解人类的意图、错误和三维手部动作。
- 规模挑战: 机器人模型需要的数据集规模远超整个 YouTube 存档;数据生成现已成为主要的业务前沿。
Encord 已开始与德国神经科学初创公司 Zander Labs 进行试点,通过为操作员配备脑电波耳机和前臂 EMG 传感器,来获取用于物理 AI 的高保真训练数据。该合作伙伴关系旨在生产一个规模足以达到 YouTube 视频总量的五倍的数据集——研究人员表示,这一规模是机器人达到人类级灵活性所必需的,并可能重塑机器人学习的方式。
为什么机器人数据是一个瓶颈
大语言模型通过抓取开放网络实现增长;其原材料丰富且廉价。相比之下,物理 AI 需要的是必须经过“制造”的数据。每一次抓取、扭转或倾倒都必须被记录、标注,并与产生这些动作的力量和意图联系起来。普通视频往往会遗漏复杂操作所需的细微线索,导致当今的模型与工厂、仓库和家庭的需求之间存在差距。
Encord 的机器人学习负责人、前 OpenAI 机器人实验室资深专家 Vineeth Velmurugan 表示,在出现一个规模约为 YouTube 视频库五倍的数据集之前,该领域将无法取得进展。问题不再是模型架构,而是如何制造数据。
添加脑电波与肌肉信号
Encord-Zander 试点项目试图通过在视觉记录中添加生理信号来填补这一空白。操作员佩戴可读取脑电图 (EEG) —— 即大脑电活动 —— 的耳机,同时前臂上的 EMG 传感器捕捉肌肉冲动。其目标是推断意图、惊讶或错误等心理状态,并将原始肌肉活动转化为视频本身无法捕捉的手部运动三维图谱。
Zander 的神经科学家 Lucas Gehrke 解释说,了解人类何时预见到一项困难的子任务,可以让机器人能够在正确的时刻分配其最强大的计算模型。
除了神经数据,Encord 还在测试一些互补技术:
- 肌电图 (EMG): 前臂上的传感器可以实时读取肌肉激活情况,从而实现对头戴式摄像头经常遗漏的手指轨迹的精确重建。
- 主从式装置 (Leader-follower rigs): 一对机械臂协同工作,其中一个镜像模仿人类操作员的动作。这可以捕捉精细的任务——如倾倒液体、堆叠芯片——在这些任务中,毫米级的误差至关重要。
- 密集标注: Velmurugan 的团队不再仅仅标注高层级的动作,而是添加细粒度的描述符,例如“右手拧紧螺栓”。他估计,对于训练特定的操控技能而言,这种细节的价值大约是原始第一视角视频的 100 倍。
数据制造的经济学
具身智能 (Physical AI) 改变了机器学习的财务计算方式。由于互联网提供了无穷无尽的文本,LLM 实验室以接近于零的边际成本构建模型。然而,生产机器人训练数据需要硬件、人类操作员和艰苦的标注工作。Encord 的内部目标是使高质量数据的成本效益比其为客户提供的价值高出 20 倍,但即使是这种激进的效率,对于大规模机器人集群而言,仍意味着数百万美元的项目规模。
赌注显而易见:能够率先生成海量、丰富标注数据集的公司,将主导新兴的自主操控市场——无论这意味着在数据中心机房插网线,还是在配送中心拣选和包装物品。随着竞争对手从人体和大脑中提取更丰富的信号,那些继续依赖纯视频流水线的公司将面临落后的风险。
反对观点与开放性问题
并非所有人都相信神经信号是缺失的那块拼图。批评者认为,增加的硬件复杂度可能会抵消其带来的收益,特别是当“视频 + 力矩传感器”组合已经能为许多工业任务提供不错的性能时。可扩展性是另一个担忧:为数千名操作员配备 EEG 耳机和 EMG 装置,对于规模较小的制造商来说可能成本过高。
数据生成流水线仍然是劳动密集型的。即使使用主从式装置,要捕捉一个真正通用机器人所需的广泛任务,也需要多个实验室和工厂之间持续、协调的努力。市场必须决定,性能的增量提升是否足以证明前期投资的合理性。
后续关注点
- 数据量里程碑: Encord 声称其数据集规模是 YouTube 的五倍,这将成为一个具体的基准。一旦公布,其他参与者将有一个明确的目标去追赶或超越。
- 硬件采用率: EEG 和 EMG 设备成为数据采集装置标准配置的速度,将预示着这种方法能否从实验性试点扩展到更大规模。
- 成本指标: 如果 Encord 能够证明其确实实现了承诺的 20 倍成本优势,可能会引发一波专注于“数据制造”而非模型设计的新进入者的浪潮。
- 性能差距
