arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

港科大地平线攻克端到端智驾瓶颈:规划算力直降30.5%,驾驶评分还更高

作者:arXivDaily编辑部 arXiv 2609.30436 cs · cs.CV · cs.RO

论文导读

香港科技大学、地平线、香港中文大学、南开大学等机构提出WALT,让自动驾驶规划器更好地利用视觉世界模型已经学到的道路信息。它先把行车轨迹转成紧凑的内部表示,再与路况画面的表示对齐,而不是直接让模型吐出一串坐标。在NAVSIM评测中,规划计算量比论文基线降低30.5%,两套评分略有提升,展示了“少算一点,也能更懂路况”的可能。

看懂道路和决定怎么开,是两回事

自动驾驶系统可能已经能从摄像头中识别车道、车辆和道路变化,甚至预测接下来画面会怎么变。可到了真正选择行车路线时,系统还要把这些丰富的视觉信息转换成一条具体轨迹。若直接从视觉特征生成一组位置坐标,相当于让一位会看地图的人只用几个数字交代驾驶计划;重要的路况关系可能在转换中丢失。

WALT关注的不是换一个更大的世界模型,而是修补这个“视觉理解到轨迹规划”的接口。研究团队保留预训练世界模型,先让另一部分学会把轨迹压成可比较的内部表示,再使它与视觉特征处在更接近的表达空间。最后,轨迹解码器才把紧凑表示还原成可执行的行驶路径。图中的上下两阶段分别对应“学会表达轨迹”和“在驾驶图像上使用这份表达”。

图:上半部训练轨迹压缩表示,下半部将其接入冻结的视觉世界模型进行规划。

为什么这样可能省算力

直接预测大量细粒度坐标,规划模块要处理许多与视觉特征不在同一层次的数值。WALT改用紧凑的轨迹表示作为中间语言,使规划器先决定“朝什么样的道路形态走”,再恢复具体轨迹。论文报告,规划部分计算量从基线的297.5 GFLOPs降到206.9 GFLOPs,约减少30.5%。这指的是论文所测模块的浮点运算量,不是整辆车功耗或芯片价格直接下降30.5%。

研究者还展示了刹车、直行、转弯与弯道等场景。图片上方是道路画面,中间是模型对画面区域的响应,下方则把规划轨迹与参考轨迹并列。它说明模型在不同路况中有可观察的对齐行为,但单张热图不是“安全性已获验证”的证据;真正的判断仍要结合完整基准与实车测试。

图:四种道路情境下的视觉响应和预测轨迹与参考轨迹对照。

分数提升有多大

在NAVSIMv1上,论文给出的PDMS由89.4升至89.8;在NAVSIMv2上,EPDMS达到87.9,比对照方案高0.6分。分数提升幅度并不夸张,真正值得关注的是它与规划计算量下降同时出现。这是一组特定离线评测结果,不能直接推断现实道路上的事故率或所有城市路况的驾驶体验。

论文还比较了直接坐标、另一种轨迹表征和WALT表征。图中的点云显示不同类型驾驶动作在内部空间的分布,热图则呈现类别之间的关系。这些分析帮助解释“对齐”在模型内部可能发生了什么,却不应被单独解读为某项驾驶任务已经落地。

图:不同轨迹编码方式的动作类别分布、相似度与相关性对照。

从基准走向车端,还要补哪一步

WALT的实用启发是,已有视觉世界模型不必完全重训,也可能通过一个更好的轨迹接口服务驾驶规划。这对车端计算预算有限的系统尤其有吸引力。不过,论文目前证明的是在NAVSIM条件下的模型与规划器表现;传感器故障、极端天气、交通参与者突发行为以及车规级延迟,仍需要独立测试。下一步的重点应是把这种表示对齐放进完整驾驶栈,检验它是否在真实时间约束下保持同样的收益。

参考资料

https://arxiv.org/abs/2609.30436

https://arxiv.org/html/2609.30436

↑