Xiaomi-Robotics-1 证明在机器人领域,数据量优于模型规模

小米发布了 Xiaomi-Robotics-1,这是一款突破性的基础模型,它将机器人训练的范式从增加算力转向了大规模数据扩展。通过利用独特的数据采集方法,该模型在陌生环境和复杂的操控任务中展现出了前所未有的适应能力。

利用手持夹持器突破数据瓶颈

机器人领域面临的主要挑战一直是“数据瓶颈”——即在没有昂贵、固定式机械臂的情况下,难以收集海量高质量的交互数据。小米通过使用配备摄像头的便携式手持夹持器绕过了这一难题。

人类操作员不再通过编程来训练机器人,而是使用这些手持设备在超过 1,700 个不同的环境中记录操控任务,包括厨房、办公室和工厂。这种方法产生了惊人的 100,000 小时运动记录。为了解决标注问题,小米采用 AI 模型为每个动作片段自动生成文本描述,仅用两周时间就完成了整个数据集的标注。

缩放法则:数据重于算力

Xiaomi-Robotics-1 研究的核心技术洞察是:增加训练数据所带来的性能提升,显著高于单纯增加模型规模或算力。虽然更大的模型确实能减少预测误差,但随着训练数据量的增加,机器人在陌生环境中的成功率从 25% 飙升至 75%。

这反映了计算机视觉领域的趋势,即增加数据比增加参数量更有价值。对于小米而言,这意味着通向通用机器人 AI 的路径在于数据集的多样性和规模,而不仅仅是构建更大的神经网络。

无与伦比的适应能力与基准测试表现

Xiaomi-Robotics-1 旨在遵循口头或书面指令,并能以极少的微调适应新任务。在测试中,该模型承担了诸如装载衣物、向打印机喂纸和打包行李箱等复杂动作。

测试结果具有决定性:

  • 快速适应: 在不到 10 小时的特定任务训练后,该模型的成功率达到了 75%,显著优于竞争对手 Physical Intelligence(后者仅为 40%)。
  • 基准测试领先: 该模型在 RoboCasa365 排行榜上大幅领先,尤其是在未见过的复合任务上。
  • RoboDojo 表现: 在 RoboDojo 基准测试中,Xiaomi-Robotics-1 的得分比亚军高出约 58%。

该模型在处理纸张等柔软、可变形材料方面也表现出特别的优势——这在历史上一直是刚性机器人系统的难点。

机器人行业的新方向

小米的方法与其他行业巨头处于不同的分叉路口。Nvidia 正试图通过合成数据生成将机器人数据问题转化为算力问题,而 BAAI 的 Orca 模型则试图从无标注视频中学习,小米则在加大对自动化、大规模标注运动数据的投入。

随着小米准备在 GitHub 和 Hugging Face 上发布该模型和代码,业界正在密切关注。这一进展表明,机器人技术的下一个前沿将不再属于拥有最强芯片的人,而是属于拥有最多样化且标注良好的运动数据集的人。

核心要点

  • 以数据为中心的缩放: 事实证明,增加训练数据量对提高机器人成功率的效果比增加模型规模或算力更显著。
  • 创新采集: 手持夹持器使小米能够在不需要专用机器人的情况下,在 1,700 个环境中积累 100,000 小时的运动数据。
  • 高泛化能力: 该模型在不到 10 小时的额外训练后,即可在新任务上达到 75% 的成功率。