BYDの新しいHyWorldVLAモデルは、NAVSIM v1ベンチマークにおいて90.59 PDMSを記録しました。これは、中国のEV巨人が自動運転基盤モデルの舞台に躍り出たことを示す記録です。PDMSは、システムが安全で効率的なルートをいかに計画できるかを測定する指標であり、スコアが高いほど、よりスムーズで信頼性の高い自動運転挙動を意味します。

この指標が重要である理由

NAVSIM v1は、複雑な交通状況におけるモデルの予測・行動能力をテストするために広く使用されているシミュレーションスイートです。90.59 PDMSという数値は、これまでに報告されたあらゆる数値を上回っており、HyWorldVLAが既存の主要プレイヤーによる初期段階のシステムに匹敵する精度で、道路上の出来事を予測できることを示唆しています。

それを可能にするアーキテクチャ

HyWorldVLAは、従来は別々であった2つのアプローチを融合させています。

  • Pixel-level prediction(ピクセルレベルの予測) – モデルは周囲の詳細な視覚的マップを保持し、車線境界線や歩行者のジェスチャーなどの微細な手がかりを維持します。
  • Latent-level reasoning(潜在レベルの推論) – シーンを高次の表現へと圧縮し、それを遠い未来まで投影することで、長期的な計画を可能にします。

純粋なピクセルモデルは詳細さに優れていますが、膨大な計算リソースを必要とするため、市販車への搭載は現実的ではありません。一方、純粋な潜在(latent)モデルは動作は速いものの、安全性に直結するような視覚的なニュアンスを切り捨ててしまいます。BYDのハイブリッド設計は、これら両方の長所を取り入れ、法外なハードウェアコストをかけることなく、より豊かな予測を実現すると謳っています。

このシステムは、Vision-Language-Action (VLA) パラダイムに従っています。まず、将来のフレームを「想像」し(vision)、次にそれらのフレームをテキストまたは記号的な記述に変換し(language)、最後にそのナラティブを具体的な車両制御へとマッピングします(action)。実際には、モデルは交通状況がどのように変化するかを予測し、その予測に基づいてステアリング、加速、またはブレーキを行います。

恩恵を受けるのは誰か

BYDは世界最大の電気自動車メーカーです。HyWorldVLAを自社のフリート(車両群)に組み込むことで、同社は前例のない規模の現実世界の走行データにアクセスできるようになります。フリートデータで学習し、更新されたモデルを配備するというこのループは、BYDの自動運転能力を加速させ、すでに大規模な自動運転フリートを運用しているTesla、Waymo、Huaweiとの差を縮める可能性があります。

不透明な点

公開されたレポートでは、モデルのサイズや使用された学習データの量が伏せられており、スケーラビリティやコストに関する疑問が残っています。ハイブリッドアプローチは、純粋なピクセルモデルよりも推論コストを抑えられると期待されていますが、純粋な潜在設計と比較すると複雑さは増します。自動車エンジニアは、性能の向上が追加の半導体やソフトウェアのオーバーヘッドに見合うものかどうかを検証する必要があります。

今後の注目点

  • 量産への展開 – BYDは、HyWorldVLAを消費者向けまたは商用車に統合するタイムラインを発表していません。限定的な市場でのパイロットプログラムが、論理的な第一歩となるでしょう。
  • ベンチマークの更新 – NAVSIM v1は、自動運転の異なる側面(悪天候、夜間走行など)を重視する新しいスイートに取って代わられる可能性があります。HyWorldVLAがそれらのテストでどのようなパフォーマンスを示すかが、その堅牢性の指標となります。
  • 競合他社の反応 – BYDのスコアが実際の路上での信頼性に結びつくのであれば、競合他社は後れを取らないよう、独自のハイブリッドモデルの研究を加速させる可能性があります。

要点:BYDの記録的なスコアは、ハイブリッドなピクセル・潜在(pixel-latent)Vision-Language-Actionモデルが、かつては専門的なAI研究所にしかできなかったレベルの計画品質を提供できることを示しています。その優位性がシミュレーションから実際の路上へと移行しても維持されるかどうかが、BYDが真に自動運転のあり方を変革するかどうかの分かれ目となるでしょう。