自动驾驶汽车多年来一直遵循着僵化的指令集。工程师们编写了数以千计的 if-then 语句。如果行人过马路,就刹车;如果红灯亮起,就停止;如果车道弯曲,就转向。当世界完全按照预期运行的时候,这种方法行之有效,但现实中的驾驶要复杂得多。规则手册无法涵盖每一条泥泞的乡间小路、未标记的交叉路口或在车流中穿梭的骑行者。当环境发生变化时,严格的指令就会失效。我们需要的是能够学习“什么是良好的驾驶”的系统,而不仅仅是遵循一份清单。

超越硬编码规则

传统的自动驾驶系统依赖于显式编程。它们在封闭环境(如仓库地面、专用车道和可预测的天气)中表现良好。但在公共道路上,同样的逻辑往往会失效。

想象一个施工区域:到处是手写的标志,锥形桶以奇怪的角度散落着,一名旗手正挥手指挥交通。基于规则的系统需要清晰的交通信号。它面对的是一片混乱。如果没有针对“穿着橙色背心并挥手示意向左”的特定规则,汽车就会停滞不前或做出错误的判断。人类驾驶员可以瞬间处理这种情况,因为我们解读的是意图和语境,而不仅仅是像素。我们能“读懂”场景。要教会机器做到这一点,需要一种根本不同的方法。

通过观察学习:Inverse Reinforcement Learning

这正是 Inverse Reinforcement Learning 改变游戏规则的地方。在标准的强化学习中,你给 AI 一个目标和一个奖励函数。快速到达目的地,获得积分;撞到路缘,扣除积分。智能体 (agent) 会不断摸索,直到发现一种能使其得分最大化的策略。但驾驶不仅仅是为了效率。它还关乎舒适度、安全性、合法性和社会规范。要为“像一个谨慎但胜任的人类那样驾驶”编写一个数学奖励函数,几乎是不可能的。

Inverse Reinforcement Learning 反转了这个问题。你不再是直接把目标交给 AI,而是向它展示示例。算法会观看数小时的人类驾驶视频。它会观察人类何时减速、何时提前变道,或者何时礼让汇入的卡车。它不仅仅是死记硬背精确的转向角度,而是通过反向推导来推断原因。也许司机减速是因为有人站在人行道旁,尽管从法律上讲路面是畅通的。AI 提取出了隐藏的奖励:即使没有人行横道,行人的接近程度也很重要。

通过将人类视为已经解决了优化问题的专家,算法可以恢复出该专家正在最小化的代价函数 (cost function)。一旦系统理解了潜在的偏好(例如,比起猛踩刹车更倾向于平稳制动,或者比起切弯更倾向于保持车道中心),它就可以进行泛化。当它遇到不同城市的新道路时,它能大致知道在那种陌生环境下,一名优秀的驾驶员会看重什么。

做出决策:Deep Q-Networks

理解奖励只是成功的一半。汽车仍然需要采取行动。Deep Q-Networks 通过处理传感器数据来选择最佳动作,从而处理决策问题。

经典的 Q-learning 已经存在了几十年。智能体学习在特定状态下采取特定动作的价值。问题在于,现实驾驶的状态几乎是无限的。摄像头画面并不是一个简单的网格世界。它是每秒 60 帧变化的数百万个像素,再加上 lidar 点云、速度读数和 GPS 向量。

Deep Q-Networks 通过使用神经网络作为函数近似器来解决这个问题。网络接收原始传感器数据,并为每个可能的动作输出预测值:左转、轻踩刹车、加速、保持航向。网络不再为每种场景存储查找表,而是进行泛化。它能识别出雨夜里的一个黑影很可能是一辆停放的汽车(就像它在晴天训练时学到的一样),并为“加速”动作分配一个较低的价值。

训练涉及 experience replay。系统存储过去驾驶中的瞬间——成功的变道、险些碰撞的时刻以及平稳的减速——然后随机采样这些数据来更新其网络。这打破了有害的相关性并稳定了学习过程。经过数千小时的模拟,网络会学习哪些动作能带来安全的进展,哪些动作会导致麻烦。

总结

单靠任何一种方法都无法培养出合格的驾驶员。没有决策引擎的逆强化学习 (Inverse Reinforcement Learning) 仅仅是一个观察者。它知道人类重视平稳性,但无法触碰方向盘。没有精心设计的奖励函数的深度 Q 网络 (Deep Q-Network) 会朝着错误的方向进行优化。它可能会发现,原地转圈可以完美地避免碰撞,从而在原地踏步的同时获得高分。

两者结合,便形成了一个强大的闭环。逆强化学习通过观察人类专家,提取出能够捕捉现实世界优先级的奖励函数。随后,深度 Q 网络利用该奖励函数通过试错进行自我训练,并处理实时传感器数据以选择动作。AI 不仅通过观察学习复杂的行为,还通过实践进行学习。

以高速公路汇入为例。逆强化学习组件已经推断出,人类驾驶员会在速度匹配与间隙接受之间寻找平衡。深度 Q 网络接收到这种细微的成本信号,并在模拟中进行一万次汇入练习。它学会了何时加速、何时等待,以及何时间隙过窄。其结果并非一个只会机械重复人类录制动作的“鹦鹉”。而是一个内化了逻辑的系统,能够在路面湿滑或间隙比平时更小时进行自我调整。

为什么这对真实道路至关重要