物理AIの最前線は、巨大なボトルネックに直面しています。高精度な実世界のトレーニングデータが不足しているのです。大規模言語モデル(LLM)はインターネット上のテキストをスクレイピングすることで成長しましたが、ロボティクスにははるかにコストのかかるアプローチが必要です。
ロボティクスにおけるデータ不足の問題
ヒューマノイドや倉庫ロボットが人間の器用さに匹敵するためには、現状存在しない規模のデータが必要です。Encordのロボット学習責任者であり、OpenAIのロボットラボのベテランでもあるVineeth Velmurugan氏は、ブレイクスルーにはYouTubeのビデオコーパス全体のおよそ5倍の規模のデータセットが必要だと述べています。
テキストは豊富にあり、スクレイピングも無料です。しかし、物理的なデータは「製造」されなければなりません。ビデオのみのトレーニングでは、複雑な操作に必要な精度が欠けることがよくあります。そのため、業界はモデルのアーキテクチャを微調整することから、高品質でアノテーション(注釈)された物理データを製造するという、より困難な問題の解決へとシフトしています。
ビデオを超えて:脳波と筋肉信号の活用
Encordのようなスタートアップは、ロボットに深いコンテキスト(文脈)を与えるために、新しいデータモダリティ(様式)をテストしています。ドイツの神経科学スタートアップであるZander Labsとのパイロットプロジェクトでは、Encordはオペレーターに脳波ヘッドセットを装着させています。神経活動を測定することで、研究者は意図、エラー、そして驚きを推論できると考えています。
Zanderの神経科学者であるLucas Gehrke氏は、脳活動を追跡することで、モデル構築者が、困難なタスクに対してロボットがいつ最も強力な計算モデルを稼働させるべきかを正確に把握できると述べています。
Encordは以下の手法も探求しています:
- Electromyography (EMG): 筋電図(EMG):前腕に装着したセンサーが筋肉の電気信号を捉え、ヘッドマウントカメラでは見落としがちな手の動きの3Dマップを作成します。
- Leader-Follower Rigs: リーダー・フォロワー・リグ:一方が人間のオペレーターを模倣するペアのロボットアームで、液体を注いだりポーカーチップを積み重ねたりといった精密な動作を捉えます。
- Dense Annotation: 高密度アノテーション:「右手でボルトを締める」といったラベル付け。Velmurugan氏は、この高密度なアノテーションは、特定のタスクのトレーニングにおいて、生の主観ビデオ(ego video)よりも100倍価値があると推定しています。
物理AIの経済的現実
デジタル第一のAIから物理AIへの移行は、機械学習の経済性を一変させます。LLMラボは、ウェブからデータを取得することで、ほぼゼロに近い限界費用でモデルを構築してきました。一方、ロボットのトレーニングデータを生成するには、ハードウェア、人間のオペレーター、そして骨の折れるアノテーション作業が必要です。Encordは、高品質なデータをその提供価値の20倍コスト効率の高いものにすることを目指していますが、それでも大規模なロボットフリート(群)にとっては数百万ドル規模のプロジェクトとなります。
大規模で豊かなアノテーションが施されたデータセットを最初に生成する企業が、イーサネットケーブルの接続から商品のピッキングや梱包に至るまで、自律的な操作の分野を支配することになるでしょう。ビデオのみのパイプラインに固執する企業は、競合他社が人体や脳からより豊かな信号を収集する中で、取り残されるリスクがあります。
主なポイント
- データの製造 vs 収集: 物理AIは、既存のインターネットデータをスクレイピングするLLMとは異なり、高精度なデータセットをコストをかけて手動で製造する必要があります。
- 神経学的モダリティ: 脳波やEMGを加えることで、ロボットはビデオ単体よりも効果的に、人間の意図、エラー、そして手の3Dの動きを把握できるようになります。
- スケールの課題: ロボティクスモデルには、YouTubeのアーカイブ全体よりもはるかに大きなデータセットが必要です。データ生成は今や、主要なビジネスの最前線となっています。
Encordは、ドイツの神経科学スタートアップZander Labsとのパイロットプロジェクトを開始しました。このプロジェクトでは、オペレーターに脳波ヘッドセットと前腕のEMGセンサーを装着させ、物理AIのための高精度なトレーニングデータを取得します。この提携は、YouTubeのビデオ総量の5倍に匹敵する規模のデータセットを作成することを目指しています。研究者によれば、この規模はロボットが人間レベルの器用さに達するために必要であり、ロボティクスの学習方法を再構築する可能性があります。
なぜロボティクスデータがボトルネックなのか
大規模言語モデルは、公開されているウェブをスクレイピングすることで成長しました。その原材料は豊富で安価でした。対照的に、物理AIは「製造」されなければならないデータを必要とします。あらゆる把握、ひねり、注ぎ動作が記録され、アノテーションされ、それを生み出した力や意図と結び付けられなければなりません。通常のビデオでは、複雑な操作に必要な微妙な手がかりを見落とすことが多く、今日のモデルと、工場、倉庫、家庭での要求との間にギャップが生じています。
Encordのロボット学習責任者であり、元OpenAIロボットラボのベテランであるVineeth Velmurugan氏は、YouTubeのビデオコーパスのおよそ5倍の規模のデータセットが存在しない限り、この分野は前進しないだろうと述べています。問題はもはやモデルのアーキテクチャではなく、データをいかに**製造(manufacture)**するかにあるのです。
脳波と筋肉信号の追加
Encord-Zanderのパイロットプロジェクトは、視覚的な記録に生理学的信号を加えることで、そのギャップを埋めようとしています。オペレーターは、脳の電気活動である脳波(EEG)を読み取るヘッドセットを装着し、前腕のEMGセンサーが筋肉のインパルスを捉えます。その目的は、意図、驚き、エラーといった精神状態を推論すること、そして生の筋肉活動を、ビデオだけでは捉えきれない手の動きの3次元マップへと変換することにあります。
Zanderの神経科学者であるLucas Gehrkeは、人間が困難なサブタスクをいつ予期しているかを知ることで、ロボットが最適なタイミングで最も強力な計算モデルを割り当てられるようになると説明しています。
神経データ以外にも、Encordはいくつかの補完的な技術をテストしています。
- 筋電図(EMG): 前腕のセンサーが筋肉の活性化をリアルタイムで読み取り、ヘッドマウントカメラでは見落としがちな指の軌道の精密な再構成を可能にします。
- リーダー・フォロワー・リグ: 一対のロボットアームが連携して動作し、一方が人間のオペレーターの動きをミラーリングします。これにより、液体を注ぐ、チップを積み重ねるといった、ミリメートル単位の誤差が重要となる繊細なタスクを捉えることができます。
- 高密度アノテーション: 高レベルのアクションのみにラベルを付けるのではなく、Velmuruganのチームは「右手がボルトを締める」といったきめ細かな記述を付与します。彼は、この詳細さは、生の第一人称視点(ego-centric)ビデオと比較して、特定の操作スキルを訓練する上で約100倍の価値があると見積もっています。
データ製造の経済学
フィジカルAIは、機械学習の経済的計算を変えつつあります。LLMの研究室は、インターネットが無限のテキストを提供してくれるため、ほぼゼロに近い限界費用でモデルを構築できました。しかし、ロボットのトレーニングデータを生成するには、ハードウェア、人間のオペレーター、そして骨の折れるアノテーション作業が必要です。Encordの内部目標は、高品質なデータを顧客に提供する価値よりも20倍コスト効率の高いものにすることですが、その野心的な効率化を実現したとしても、大規模なロボットフリート向けのプロジェクトは依然として数百万ドル規模となります。
賭け目は明確です。膨大で豊かなアノテーションが施されたデータセットを最初に生成できる企業が、データセンターのフロアでイーサネットケーブルを差し込む作業であれ、配送センターでの商品のピッキングや梱包であれ、自律操作の新たな市場を支配することになるでしょう。ビデオのみのパイプラインに頼り続ける企業は、競合他社が人体や脳からより豊かな信号を抽出するようになるにつれ、取り残されるリスクがあります。
反論と未解決の問い
神経信号が「欠けているピース」であると誰もが確信しているわけではありません。批判的な人々は、ビデオと力・トルクセンサーの組み合わせですでに多くの産業タスクで十分な性能が得られている場合、ハードウェアの複雑さが増すことによるデメリットがメリットを上回る可能性があると主張しています。スケーラビリティも懸念事項です。数千人のオペレーターにEEGヘッドセットやEMGリグを装備させることは、中小規模のメーカーにとってはコスト的に困難となる可能性があります。
データ生成のパイプラインは依然として労働集約的です。リーダー・フォロワー・リグを使用しても、真に汎用的なロボットに必要な幅広いタスクを捉えるには、複数の研究所や工場にわたる持続的かつ調整された努力が必要となります。漸進的な性能向上が、先行投資に見合うものかどうかを市場が判断することになるでしょう。
今後の注目点
- データ量のマイルストーン: YouTubeの5倍の規模のデータセットを持つというEncordの主張は、具体的なベンチマークとなるでしょう。それが公開されれば、他のプレーヤーにとって、それに匹敵するか上回るための明確な目標となります。
- ハードウェアの採用率: EEGやEMGデバイスがデータ収集リグの標準となるスピードは、このアプローチが実験的なパイロットを超えてスケールするかどうかを示す指標となります。
- コスト指標: もしEncordが約束通りの20倍のコスト優位性を実証できれば、モデル設計ではなく「データ製造」に焦点を当てた新規参入者の波を呼び起こす可能性があります。
- 性能の差
