中国的 Orca 世界模型在无需动作标签的情况下达到专业机器人水平
来自中国研究人员的一项突破正在挑战人工智能智能的基本定义,他们证明了一个统一的世界模型可以在没有直接监督的情况下掌握机器人技术。Orca 模型表明,通过仅仅观察视频中世界的变化,人工智能可以建立起一种深层的内部理解,从而能够驱动复杂的物理动作。
双重学习引擎:无意识与有意识模式
Orca 摒弃了传统的专业化模型,采用双管齐下的训练方法来构建其内部的“世界状态”。第一种方法是“无意识学习”(unconscious learning),涉及处理 125,000 小时的无标签视频。在此阶段,模型在抽象空间中预测未来的帧,使其能够在不需要任何文本说明的情况下,掌握运动模式、物体遮挡和场景动态。
第二种方法是“有意识学习”(conscious learning),引入了语言指令和描述。通过对视频进行分段并对产生的状态变化进行标注,Orca 学习了特定动作与其物理结果之间的因果关系。这种结合使模型能够弥合原始视觉感知与高层语言推理之间的鸿沟。
带有可更换智能模块的冻结核心
Orca 的架构设计具有极高的通用性。它利用预训练的 Qwen3.5 语言-图像模型作为“冻结核心”。研究人员并没有为每个任务重新训练整个系统,而是将专门的、轻量级的“头”(heads)附加到这个稳定的基础上:
- 文本输出: 使用现有的 Qwen3.5 语言头。
- 图像生成: 采用连接到 Stable Diffusion 3.5 的小型适配器,将内部世界状态转化为视觉预测。
- 机器人控制: 利用专门构建的 “Action Expert” 模块,该模块经过专门训练,可将世界状态转化为物理动作。
这种模块化设计确保了对世界的中心理解保持一致,无论模型是在回答问题、生成视频还是控制机械臂。
超越专业模型与巨头
Orca-4B 的性能指标非常显著。在基于文本的视频基准测试中,Orca-4B 达到了平均 51.8%,超越了像 Emu3 (34B) 这样的大得多的模型,以及像 DeepSeek-VL2-3B 这样的专业视觉语言模型(VLM)。在通过 PRICE-V0.1 基准测试进行的图像预测任务中,Orca-4B 得分为 59.8%,超过了 FLUX.2 small 等高端生成器。
最令人印象深刻的是,在堆叠碗筷和舀糖等五项操作任务中,Orca 展示了与 $\pi$0.5(一个完全基于机器人动作数据构建的系统)相当的性能。至关重要的是,Orca 在其大规模预训练阶段从未见过动作标签,却实现了这一目标。它甚至表现出更优越的错误恢复能力,在专业模型经常陷入重复循环的情况下,它能够重新尝试失败的抓取。
为什么这对 AI 的未来至关重要
Orca 解决了现代机器人技术中最显著的瓶颈之一:标注动作数据的长期短缺。通过证明人工智能可以通过被动观察来学习“世界的物理规律”,这项研究为通用机器人的发展铺平了道路,使其能够在无需数百万小时人工标注的遥操作数据的情况下,部署到新环境中。
核心要点
- 无监督基础: Orca 通过对无标签视频的“无意识学习”来学习世界动态,减少了对昂贵的人工标注数据集的依赖。
- 模块化架构: 使用冻结的 Qwen3.5 核心配合可更换的适配器,使一个模型能够同时在文本、图像和机器人控制方面表现出色。
- 机器人性能对等: 尽管在预训练期间从未接触过动作标签,Orca-4B 在操作任务中的表现仍能与专业的机器人系统相媲美。