Google DeepMindのRT-2、Stanford-ToyotaのOpenVLA、NVIDIAのGR00T、Hugging FaceのLeRobot、そしてPhysical IntelligenceのPi-Zeroは、視覚入力、言語コマンド、およびモーターアクションを単一のモデルで結びつける能力をロボットに提供します。この能力は、手動でコード化されたステップシーケンスを「見て、行う(see-and-do)」動作に置き換え、開発の高速化とロボティクスへのより幅広いアクセスを約束します。
なぜVision-Language-Actionが重要なのか
ロボティクスの歴史の大部分において、エンジニアはロボットの各関節の動きを指示する明示的なスクリプトを記述してきました。新しいクラスのVision-Language-Action (VLA) モデルは、ロボットを対話型エージェントのように扱います。カメラが画像をストリーミングし、ユーザーがリクエストを話すか入力すると、モデルはそれを実行するために必要なモーターコマンドを出力します。
注目の5つのモデル
- RT-2 (Google DeepMind) – 生の視覚ストリームを人間の言語に接続し、ロボットが見ているものを説明したり、音声指示に基づいて行動したりすることを可能にします。
- OpenVLA (Stanford + Toyota) – オープンソースとして公開されており、あらゆる開発者がモデルを独自のハードウェアに組み込むことができます。
- GR00T (NVIDIA) – ヒューマノイドプラットフォーム向けに構築されており、シーンを推論して低レベルのモーターコマンドを生成します。
- LeRobot (Hugging Face) – データリポジトリとツールセットを提供し、ロボット開発者のモデルトレーニングと統合を加速させます。
- Pi-Zero (Physical Intelligence) – 単一の「脳」を異なるロボットの体に再利用できるとしており、多様なハードウェア向けのソフトウェアスタックを簡素化します。
データ、シミュレーション、そしてドリフト問題
これら5つのモデルはすべて膨大なデータセットに依存していますが、その大部分はシミュレーション環境から得られたものです。これは、現実世界でのデータ収集にはコストとリスクが伴うためです。この依存関係は「sim-to-real」のドリフトを引き起こします。つまり、完璧な仮想世界で学習された動作が、ノイズの多いセンサー、不均一な照明、あるいは予期せぬ障害物に直面した際に、うまく機能しなくなる可能性があるのです。
