新しいAIアーキテクチャにより、火星や月のローバーが、地球との4〜24分間の往復通信を待つことなく、何を調査し、どのように移動するかを自律的に判断できるようになる可能性があります。これにより、迅速な意思決定を妨げている現在の遅延(レイテンシ)を解消できます。decision-transformerモデルにゼロトラスト・ガバナンス層を組み合わせたこの提案は、将来の惑星探査ミッションにおいて「科学者レベル」の自律性を実現することを約束します。

なぜローバーに自律的な思考が必要なのか

現在のローバーは、本質的に遠隔操作の車のようなものです。地球からのコマンドはキューに留まり、ロボットは返答を待つことになります。また、予期せぬ障害物が発生するたびに、ミッションが数時間停止してしまうこともあります。

AIのブレイクスルー:decision transformers

decision transformersは、行動の選択を言語モデリングのタスクへと変換します。試行錯誤によって学習する代わりに、このモデルは過去の状態のシーケンス(位置、センサーの読み取り値など)と、それに関連する報酬(科学的価値、安全スコアなど)をスキャンし、報酬を最大化するであろう次の行動を予測します。実質的に、AIはこれまでの物語の展開に基づいて、物語の「次の最適な一行」を書き上げるようなものです。

AIを宇宙仕様の安全なものにする

設計には2つの安全策が組み込まれています。

  • 人間と整合した目的(Human-aligned objectives) – チームは、ミッションにおいて極めて重要な3つの目標、すなわち「科学的成果の最大化(例:最も興味深い岩石の選択)」、「危険の回避(急斜面、電力喪失など)」、「ミッション制約の遵守(時間、データ帯域幅など)」のバランスを取るようにモデルを訓練します。AIが勝手な行動をとることはありません。すべての選択は、人間が定義したこれらの優先順位に基づいて重み付けされます。

  • ゼロトラスト・ガバナンス(Zero-trust governance) – サイバーセキュリティから取り入れられたこのフレームワークは、ローバーの「脳」が侵害されたり、単に誤作動したりする可能性があることを前提としています。エンジニアはすべての決定を改ざん不可能な監査トレイルに記録し、AIには行動に必要な最小限の権限(最小権限の原則)のみを付与します。

これらの層を組み合わせることで、指揮系統の透明性と可逆性を維持しながら、ローバーが自律的に行動できるようになります。

恩恵を受けるのは誰か

Mars Sample Return(火星サンプルリターン)や月極域探査のような将来のミッションには、このレベルの自律性が必要です。transformerモデルと厳格なセキュリティプロトコルを組み合わせることで、太陽系のより深部を調査することが可能になります。

潜んでいるリスク

自律性はリスクの性質を変えますが、ゼロトラスト層がすべての動きを検証器(verifier)に通すことで、そのリスクを軽減します。

次のステップ

この手法は著者の研究に掲載されており、惑星地質調査ミッションのための手法を提案しています。

要点: ローバーに意思決定を言語の問題として扱うよう教え、その能力を「監査第一」の厳格なセキュリティモデルで包み込むことにより、エンジニアは、地球との通信が届かない状況でも、自らの判断で科学を探求できるロボットの実現へと近づいています。