论文导读
KE:SAI、苏黎世联邦理工学院、英伟达研究院和斯坦福大学团队提出OPTED,用只看高清地图与车辆框的教师策略,给看相机画面的端到端驾驶模型做闭环后训练。两种学生模型的驾驶分数分别提高1.6倍和9.5倍,受控实验所需仿真交互约少三个数量级。
开环学得再像,闭环也会越开越偏
端到端驾驶模型通常从人类日志做行为克隆:给定一帧相机画面,学习人类当时如何转向。训练数据中的车辆大多位于正常车道。一旦部署时出现小误差,车辆会进入日志里很少出现的位置;下一步观察继续偏离,误差层层累积。
强化学习可以在闭环里让策略面对自己的错误,但相机模型每次交互都要渲染画面并运行大网络,成本很高。OPTED把强化学习放到更轻的教师上,再让教师为相机学生提供训练目标。
图1:学生读取渲染相机画面,教师只读取高清地图、车辆框和状态。
教师不用看像素,只负责告诉学生往哪走
教师策略以高清地图和边界框等向量信息为输入,在轻量环境中用强化学习训练。学生仍是实际要部署的相机模型。闭环采集时,学生先在AlpaSim里开车;教师被同步到同一状态,向前滚动并给出更好的路径点;这些标签进入缓冲区更新学生。
这样,昂贵的像素渲染只服务学生的闭环数据采集,不必同时承担大规模强化学习探索。教师训练一次后还能复用于不同学生模型。
图2:方法把闭环数据采集、向量教师标注和相机学生更新拆成三个步骤。
两个学生模型,提升幅度差得很大
团队把OPTED用于TransFuser和VaVAM,并在AlpaSim中使用真实驾驶日志的3D高斯重建场景。论文报告,两者驾驶分数分别提高1.6倍和9.5倍。幅度差异说明后训练收益与学生原始能力、指标基线和错误类型有关,不能把9.5倍套到所有端到端模型。
图3:上行为原VaVAM,下行为加入OPTED后的同类道路序列与规划轨迹。
在受控比较中,OPTED用约少三个数量级的模拟器交互,达到直接强化学习后训练相近的闭环表现,同时更接近人类驾驶先验。这里的“少千倍”是交互次数的数量级描述,不是整套训练墙钟时间缩短千倍;渲染、学生推理和更新仍占用GPU时间。
下一步从重建仿真走向真实道路验证
论文实验依赖AlpaSim与驾驶日志重建,没有给出公开道路实车安全结论。真实部署还要面对传感器噪声、施工、恶劣天气和其他道路参与者。后续可用同一教师框架比较更多相机策略,记录闭环失误类型,并在封闭场地逐步验证:仿真中减少交互的优势能否转化为更短训练周期,以及学生是否会继承教师地图先验的偏差。
参考资料
https://arxiv.org/abs/2609.20756
https://arxiv.org/html/2609.20756