Xiaomi-Robotics-1、ロボティクスにおいてモデルサイズよりもデータ量が重要であることを証明

Xiaomiは、ロボット学習のパラダイムを計算能力の向上から大規模なデータスケーリングへと転換させる画期的な基盤モデル「Xiaomi-Robotics-1」を発表しました。独自のデータ収集手法を活用することで、このモデルは未知の環境や複雑な操作タスクにおいて、かつてない適応力を示しています。

ハンドヘルド・グリッパーによるデータボトルネックの解消

ロボティクスにおける主要な課題は、常に「データボトルネック」でした。つまり、高価で固定式のロボットアームを使わずに、膨大な量の高品質なインタラクションデータを収集することの難しさです。Xiaomiは、カメラを搭載したポータブルなハンドヘルド・グリッパー(手持ち式グリッパー)を利用することで、この問題を回避しました。

ロボットにプログラミングを行う代わりに、人間のオペレーターがこれらのハンドヘルドデバイスを使用して、キッチン、オフィス、工場を含む1,700以上の多様な環境で操作タスクを記録しました。このアプローチにより、驚異的な10万時間の動作記録が得られました。ラベル付けの問題を解決するため、XiaomiはAIモデルを採用して各動作セグメントのテキスト説明を自動生成し、わずか2週間でデータセット全体のラベル付けを完了させました。

スケーリング則:計算量よりもデータ量

Xiaomi-Robotics-1の研究から得られた核心的な技術的知見は、単にモデルサイズや計算量を増やすよりも、トレーニングデータを増やす方が大幅に高いパフォーマンス向上をもたらすということです。モデルの大型化によって予測エラーは減少しますが、トレーニングデータの量が増えるにつれて、未知の環境におけるロボットの成功率は25%から75%へと急上昇しました。

これは、パラメータ数を増やすよりもデータを追加する方が価値が高いとされるコンピュータビジョンのトレンドを反映しています。Xiaomiにとって、汎用ロボットAIへの道は、単に巨大なニューラルネットワークを構築することではなく、データセットの多様性と規模にあることを意味しています。

比類なき適応力とベンチマーク性能

Xiaomi-Robotics-1は、音声または書面による指示に従い、最小限のファインチューニングで新しいタスクに適応するように設計されています。テストでは、洗濯物を入れる、プリンターに用紙をセットする、スーツケースに荷物を詰めるといった複雑な動作が課されました。

結果は決定的でした:

  • 迅速な適応: 10時間未満のタスク特化型トレーニングで、モデルは75%の成功率を達成しました。これは、わずか40%にとどまった競合のPhysical Intelligenceを大幅に上回る数値です。
  • ベンチマークでの圧倒的優位: このモデルは、特に未知の複合タスクにおいて、RoboCasa365のリーダーボードを大差でリードしています。
  • RoboDojoでの性能: Xiaomi-Robotics-1は、RoboDojoベンチマークにおいて、準優勝者よりも約58%高いスコアを記録しました。

また、このモデルは、従来の剛体ロボットシステムにとって歴史的に困難であった、紙のような柔らかく変形しやすい素材の扱いに特に強みを示しました。

ロボティクス業界の新たな方向性

Xiaomiのアプローチは、他の業界大手との分岐点にあります。Nvidiaが合成データ生成を通じてロボティクスのデータ問題を計算の問題へと転換しようとし、BAAIのOrcaモデルがラベルなしビデオからの学習を試みている一方で、Xiaomiは自動化された大規模なラベル付き動作データに注力しています。

XiaomiがGitHubとHugging Faceでモデルとコードを公開する準備を進める中、業界は注視しています。この進展は、ロボティクスの次なるフロンティアを制するのは、最も強力なチップを持つ者ではなく、最も多様で適切にラベル付けされた動作データセットを持つ者であることを示唆しています。

主なポイント

  • データ中心のスケーリング: トレーニングデータの量を増やすことは、モデルサイズや計算量を増やすよりも、ロボットの成功率向上において効果的であることが証明されました。
  • 革新的な収集方法: ハンドヘルド・グリッパーにより、専用のロボットを必要とせずに、1,700の環境にわたる10万時間の動作データを蓄積することが可能になりました。
  • 高い汎用性: このモデルは、10時間未満の追加トレーニングで、新しいタスクにおいて75%の成功率を達成できます。