论文导读
ZYT AI团队提出ZYT-World,把40步双向教师蒸馏成一步生成器,同时输出四路鱼眼和三路针孔相机画面。论文报告生成器计时快107.7倍,并保留教师超过90%的PSNR和SSIM,还加入跨轨迹地点记忆,用于车辆重访场景。
闭环驾驶需要世界模型跟得上车辆
自动驾驶世界模型根据车辆动作生成下一刻多相机画面,可用于仿真和策略测试。扩散式生成通常需要多轮迭代,单路视频尚且耗时,七路视角还必须在几何与时间上保持一致,延迟很容易超过实时闭环预算。
ZYT-World面向完整环视配置:四路鱼眼覆盖近场,三路针孔相机观察更远区域。模型不仅要让每一路清晰,还要保证同一车辆、路口和行人在相邻相机里位置相容,连续帧也不能随意改变身份。
图:论文案例同时展示四路鱼眼与三路针孔相机的生成画面。
把40步教师压成单步流式生成
团队先训练质量较高的40步双向教师,再将其知识蒸馏到一步逐潜变量生成器。教师能利用更完整的上下文优化画面,学生则用一次前向过程降低延迟,并按时间持续接收车辆状态与历史表示。
论文称一步生成器的计时比教师快107.7倍,PSNR和SSIM仍保留超过90%。这个倍数仅统计生成器,并不等于整个自动驾驶栈提速同样幅度;传感预处理、控制、渲染传输和评测也会占用时间。
图:论文方法图说明不同驾驶轨迹如何共享特定地点的隐式记忆。
重访地点时,画面不该每次重新想象
常规视频模型主要依靠当前轨迹历史。车辆隔一段时间再次经过同一路口,模型可能生成外观不同的建筑、车道或路边物体。ZYT-World通过跨轨迹配对训练隐式记忆模块,让重访时能取回地点相关证据。
这种记忆对闭环测试很重要:如果静态场景每次经过都变化,策略面对的就不是同一个世界。但内部多视角测试集仍限制了结论范围,记忆也可能把临时车辆、施工或天气误当成永久特征,需要区分稳定地图信息与动态事件。
图:论文夜间案例用于观察低光条件下多视角画面的一致性。
落地方向:速度之外还要验证可驾驶性
世界模型用于训练或评测车辆时,像素指标只是第一关。后续应检查生成画面中的车道拓扑、交通灯状态、运动轨迹和碰撞关系,并让独立驾驶策略在生成环境中闭环运行,比较其决策与真实记录是否一致。
地点记忆还需要更新与遗忘机制:道路施工后旧证据应降权,敏感位置数据应有保存期限。团队也应分别报告七路同步误差、长时间漂移和极端天气失败率,避免平均画质掩盖某一路关键相机失真。
ZYT-World把实时、多相机和跨轨迹记忆放进同一系统,朝可交互驾驶仿真迈了一步。它的实际价值最终不由“看起来像”决定,而由生成世界能否稳定保留会影响驾驶决策的事实决定。