比亚迪(BYD)全新的 HyWorldVLA 模型在 NAVSIM v1 基准测试中获得了 90.59 PDMS 的高分,这一纪录使这家中国电动汽车巨头跻身自动驾驶大模型领域。PDMS 用于衡量系统规划安全、高效路线的能力;分数越高,意味着自动驾驶行为越平稳、越可靠。

为什么该指标至关重要

NAVSIM v1 是一款广泛使用的仿真套件,用于测试模型在复杂交通环境中的预测和行动能力。达到 90.59 PDMS 打破了此前报道的所有数值,这表明 HyWorldVLA 预测道路事件的精度足以媲美行业领先厂商的早期系统。

实现这一目标的架构

HyWorldVLA 融合了两种传统上相互独立的方案:

  • 像素级预测 (Pixel-level prediction) —— 模型保留了周围环境的详细视觉地图,能够捕捉车道线和行人手势等细粒度线索。
  • 潜空间级推理 (Latent-level reasoning) —— 它将场景压缩为高阶表示,并能将其投射到更远的未来,从而实现长期规划。

纯像素模型擅长处理细节,但需要巨大的计算量,这使得它们在量产车上并不实用。纯潜空间模型运行速度更快,但会丢弃可能关乎安全的视觉细节。比亚迪的混合设计声称兼顾了两者的优点,在不产生高昂硬件成本的前提下,提供了更丰富的预测能力。

该系统遵循视觉-语言-动作 (Vision-Language-Action, VLA) 范式。首先,它“想象”未来的帧(视觉),然后将这些帧转化为文本或符号描述(语言),最后将这些叙述映射为具体的车辆控制指令(动作)。在实际应用中,模型会预测交通状况的演变,并利用该预测来进行转向、加速或制动。

谁将从中受益

比亚迪是全球最大的电动汽车制造商。将 HyWorldVLA 嵌入其车队,将使公司能够获得前所未有的海量真实驾驶数据。这种“利用车队数据进行训练,再部署更新模型”的闭环,可能会加速比亚迪自动驾驶能力的提升,并缩小其与 Tesla、Waymo 和华为等已拥有大规模自动驾驶车队的厂商之间的差距。

不确定因素

公开报告并未透露模型的规模和所使用的训练数据量,这引发了人们对可扩展性和成本的疑问。虽然混合方法有望比纯像素模型降低推理成本,但与纯潜空间设计相比,它仍然增加了复杂性。汽车工程师需要验证性能的提升是否足以抵消额外的芯片或软件开销。

后续关注点

  • 量产落地 —— 比亚迪尚未宣布将 HyWorldVLA 集成到消费级或商用车辆中的时间表。在有限市场开展试点项目将是逻辑上的第一步。
  • 基准测试更新 —— NAVSIM v1 可能会被更先进的套件所取代,这些套件将侧重于自动驾驶的不同方面(例如恶劣天气、夜间驾驶)。HyWorldVLA 在这些测试中的表现将体现其鲁棒性。
  • 竞争对手的反应 —— 如果比亚迪的分数能转化为实际道路上的可靠性,竞争对手可能会加快自身混合模型的研发进度,以避免落后。

核心结论:比亚迪创纪录的得分表明,混合像素-潜空间视觉-语言-动作模型可以提供曾经只有专业 AI 实验室才能实现的规划质量。这种优势能否经受住从仿真环境到真实街道的跨越,将决定比亚迪是否能真正重塑自动驾驶领域。