论文导读
香港中文大学(深圳)、小鹏汽车、西安电子科技大学等机构提出RoXDrive,让自动驾驶策略只从“听指令”的世界模型片段中学习。它在nuScenes上把DiffusionDrive的安全违规减少27.6%,并在超过13万段场景的内部数据上持续取得改进。
世界模型也可能说一套做一套
自动驾驶策略常从人类驾驶日志里模仿,但部署后会遇到自己动作造成的新局面。视频世界模型可以生成未来道路,让策略在虚拟环境里反复试错;问题是,模型生成的画面未必忠实反映方向盘和加速指令,车辆明明左转,画面却可能继续直行。用这种片段强化学习,会把错误因果关系教给策略。
图:道路未来序列与动力学曲线展示动作和画面的对应关系。
RoXDrive为此增加动作—视觉忠实度评估器。它从生成画面反推车辆动作,并结合几何轨迹监督,检查长序列中的道路变化是否与给定动作一致。只有通过检查的片段才进入后续训练,相当于给世界模型输出装上一道事实核验。
只保留可信片段再强化学习
策略先按常规示范数据预训练,再与世界模型交互生成多步未来。评估器过滤动作不一致的轨迹,剩余片段依据碰撞、越界等安全信号获得密集评分,最后用于场景级闭环强化学习。这个流程可以接到不同规划器上,不要求重建一套全新的仿真平台。
图:方法图说明策略、世界模型与忠实度评估器之间的数据流。
项目图把道路序列和逆动力学判断并排展示:重点不是画面看起来多真实,而是车辆动作是否真的改变了未来。对驾驶策略而言,可信的反事实比单纯高清的视频更有训练价值。
27.6%对应基准内的违规变化
在nuScenes设置中,RoXDrive让DiffusionDrive的安全违规减少27.6%;在内部数据上,Qwen3-VL方案的违规减少33.7%。内部训练评估覆盖超过13万段场景,并在不同规划器上观察到一致收益。
图:安全规则对比与道路预测画面共同呈现过滤后的训练效果。
这些数字来自数据集和世界模型构成的评估闭环,不等于量产车辆道路事故率下降。天气、传感器故障、长尾交通参与者和法规行为还需要实车或更严格仿真验证;论文证明的是过滤动作失真的训练片段能改善既定安全指标。
未来需要可审计的交互质量
未来的重点不只是生成更逼真的道路视频,还要报告动作忠实度在急刹、并线、遮挡和复杂路口中的误判率。若评估器漏过错误片段,强化学习可能放大偏差,因此过滤器本身也应接受独立测试。
对自动驾驶研发,这套思路提供了一个实用接口:世界模型负责提出未来,忠实度模型负责验真,安全评分负责告诉策略哪种行为更好。三者分开记录后,团队能定位收益来自生成质量、过滤质量还是奖励设计。
参考资料
https://arxiv.org/abs/2609.36851