Qwen-Drive-1.0 将感知、规划和语言整合进单一模型中,有望为自动驾驶工程师提供一个更简洁的技术栈,同时又不牺牲遵循语音或文本指令的能力。这种统一的架构可以在降低开发复杂度的同时,让汽车能够回答“你为什么要转弯?”或服从“从下一个出口驶出”等指令。
为什么统一的基础模型至关重要
目前大多数自动驾驶软件都是由多个独立模块拼凑而成的:一个用于解析摄像头和激光雷达数据的视觉系统,一个决定行驶轨迹的规划器,以及一个处理用户指令或解释的语言接口。由于每个部分都是独立训练的,当视觉或规划部分的损失函数(loss)占据主导地位时,语言组件往往会发生偏移。其结果是,车辆虽然能够行驶,但无法可靠地理解或生成自然语言。
Qwen-Drive-1.0 通过在三个任务上同时训练单一骨干网络来解决这种碎片化问题——即 3D 感知、视觉问答 (VQA) 和运动规划。通过将驾驶数据集与通用视觉语言语料库相结合,该模型在学习观察和行动的同时,保留了其语言知识。这种“多模态基础模型”借鉴了大型语言模型作为许多下游应用基础的趋势,但它增加了安全导航所需的空间推理能力。
模型是如何评估的
研究人员对该模型进行了开环和闭环测试。在开环场景中,系统处理记录的传感器流并生成预测,而不会影响环境;在闭环试验中,它则实际控制一辆模拟车辆。在这些设置下,Qwen-Drive-1.0 的运动规划性能媲美仅专注于驾驶的专业化模型。与此同时,其 VQA 组件能够回答有关场景的查询,表明语言能力在联合训练中得以保留。
尚存的障碍
目前的工作尚未实现全套传感器套件。高分辨率激光雷达输入和长程预测(两者对于高速公路驾驶都至关重要)在训练集中是缺失的。感知能力也依赖于有限的数据集集合,这引发了关于其对不同天气、光照和交通状况泛化能力的疑问。在模型能够在真实世界的高带宽传感器流上证明自己之前,工程师们可能会对替换现有的成熟流水线持谨慎态度。
如果该方法规模化,可能会带来哪些变化
如果单一的基础模型能够处理整个“感知-规划-语言”技术栈,汽车团队就可以抛弃多个独立模块之间错综复杂的编排。这将降低集成工作量,减少模块间通信带来的延迟,并简化更新:例如,可以在不重新训练规划器的情况下增加新的语言能力。自动驾驶的基准测试套件也需要随之演进,在传统的安全性和效率评分之外,增加以语言为中心的指标。
反方观点:专业化仍占有一席之地
专业化模型之所以表现出色,是因为它们可以在海量的领域特定数据上进行微调。统一模型可能难以达到仅依靠激光雷达的感知网络,或是在数十亿英里驾驶日志上训练的规划器所能达到的绝对峰值性能。对于安全关键型功能,监管机构和制造商可能会继续要求使用经过广泛验证的专用组件。
下一步值得关注的方向
未来的版本应揭示 Qwen-Drive-1.0 是否能够摄取高分辨率激光雷达数据并进行长时程预测。真实的道路测试,尤其是在多变的城市环境中,将是这种统一方法方法的试金石。如果这些试验取得成功,行业可能会转向将语言视为自动驾驶汽车中“一等公民”的多模态基础模型。
