自动驾驶模型如果每次思考要717毫秒,车辆一秒只能更新约1.4次决策。普林斯顿大学与加州大学圣迭戈分校提出FlashDrive,把Alpamayo 1.5-10B视觉—语言—动作模型在单张GPU上的端到端延迟压到151毫秒,频率升至6.6Hz,整体提速4.7倍。
这项工作瞄准的不是单个矩阵乘法,而是从传感器输入、视觉编码、语言推理到轨迹解码的完整链路。大型VLA能利用丰富语义判断道路场景,但参数量、图像token和自回归步骤叠加后,反应速度很难满足闭环驾驶。
先画出延迟账单,再决定每一部分怎么压
FlashDrive先对Alpamayo各模块逐项分析,找出视觉骨干、大语言模型、动作头和数据搬运所占时间。团队没有给所有层套同一量化策略,而是根据误差敏感度选择精度,在保留关键计算的同时,把主要权重和激活压到W4A8,也就是4比特权重、8比特激活。
FlashDrive将端到端驾驶延迟从717毫秒降到151毫秒。
量化只是其中一环。FlashDrive还处理视觉token、缓存、算子融合和推理调度,使中间结果不在不同格式和设备区域之间反复搬运。它的目标是让模型真正以更高频率输出轨迹,而不是只报告某一层的理论吞吐。
驾驶轨迹误差只移动0.08米
压缩大模型最怕速度提高后,方向盘输出变得不稳定。论文用minADE6比较量化前后的候选轨迹,分布变化仅0.08米,说明低比特推理基本保留了原模型的轨迹行为。对自动驾驶而言,这类输出级指标比语言困惑度更直接,因为它反映车辆未来路径是否发生实质偏移。
FlashDrive在VLA各模块上的流式执行与压缩设计。
团队还在闭环仿真中测试车辆持续执行模型决策的结果。量化后的系统在碰撞和驶出道路等指标上没有退化,部分结果反而更好。作者认为更高的决策频率减少了控制滞后:即使单次轨迹几乎相同,更快刷新也能更早响应前车与弯道变化。
单GPU跑到6.6Hz,系统优化会改变闭环表现
从717毫秒到151毫秒意味着每秒决策从1.4次提升至6.6次。4.7倍加速来自Alpamayo 1.5-10B的特定单GPU、W4A8配置,不能直接推算到所有车型和芯片;真实车辆还要计入相机同步、预处理、规划接口和执行器延迟。不过,论文证明10B级VLA并非只能停留在离线回放。
FlashDrive在闭环驾驶中的延迟、轨迹与安全指标。
FlashDrive在AlpaSim闭环场景中的驾驶表现。
另一个值得注意的结果是“压缩后闭环更好”并不神秘:开放环节只看预测与数据集答案的距离,而闭环中当前动作会改变下一帧输入。降低延迟后,系统更少拿过时画面做决策,因此量化的微小误差可能被更新频率的收益抵消。
下一步走向车端芯片与实时安全验证
FlashDrive提供了一套可复用的方法:先测整条链路,再按模块敏感度压缩,最后用闭环而非单点精度验收。未来可将相同分析迁移到不同VLA、车端GPU与专用加速器,比较功耗、显存、首帧延迟和持续吞吐,而不只盯着模型参数量。
进入实际车辆后,还可以把安全关键场景设成动态精度开关:普通巡航采用低比特高速路径,复杂路口或罕见目标出现时提高部分模块精度。结合异步传感器处理和轨迹安全盾,151毫秒的研究原型有机会继续逼近更高控制频率。FlashDrive的意义在于说明,模型智能与系统实时性需要一起设计,端到端VLA才可能真正参与驾驶闭环。
部署团队还需要记录尾延迟,而不只是平均值。自动驾驶最担心少数帧突然卡顿,因此后续测试应同时报告P95、P99延迟、长时间温度与功耗,以及不同相机数量下的吞吐。若FlashDrive能在这些压力条件下保持稳定,量化收益才会真正转化成制动距离和控制余量。
这套优化也适合与模型早退结合:简单直路快速输出,复杂场景调用更深层推理。系统可依据场景风险动态分配计算预算,在固定车端功耗里争取更高平均频率,同时为罕见事件保留模型容量。