arXivDaily arXiv每日学术速递 周一至周五更新
紧急更新!大量爬虫把网站搞的很不稳定,部分功能限制为登录后才能使用,如高级检索等

PAPERDAILY REPORTS

Qwen下场做自动驾驶,一个4B模型同时感知、问答和规划

作者:arXivDaily编辑部 arXiv 2609.00111 cs · cs.CV

通义千问团队、华中科技大学联合提出Qwen-Drive-1.0。这个4B视觉语言模型把3D感知、驾驶视觉问答和运动规划放进同一框架,并在开环、伪闭环和闭环设置中评估规划表现。

共享表征连接三类驾驶任务

Qwen-Drive保留预训练视觉语言模型的主体结构。外接鸟瞰感知头从共享表征中完成3D目标检测、语义占据预测和BEV地图分割,规划专家再根据同一表征生成自车未来轨迹。

视觉问答负责描述交通灯、道路结构、车辆和行人等场景信息。这样设计的目标不是让语言答案直接控制车辆,而是检查同一组视觉表征是否同时保留可解释的场景知识和规划需要的几何信息。

图:论文案例展示道路车辆和交通参与者感知。

分阶段训练避免驾驶数据挤掉通用能力

团队把驾驶监督与通用视觉语言数据组合到分阶段训练流程中。驾驶任务需要精确坐标、占据关系和轨迹,通用数据则维持图像理解与指令遵循;若只在驾驶数据上持续微调,模型可能在普通视觉问答上出现明显退化。

论文通过外部BEV头提供可检查的3D接口,也承认统一模型并不等于所有模块都由语言模型独立完成。检测、地图分割和轨迹生成仍有专门头部,它们共享表征,但承担不同输出约束。

图:论文案例展示施工区域与目标识别。

闭环测试不等于量产道路部署

实验覆盖公开驾驶数据与仿真评测,并报告3D感知、驾驶问答和规划的竞争性结果。开环看预测轨迹与记录轨迹的差异,伪闭环和闭环进一步观察模型动作改变后场景如何演化,能比单帧指标更接近实际控制问题。

这些结果仍不能替代真实道路安全验证。论文没有证明4B模型能在量产车上覆盖传感器故障、恶劣天气、长尾交通参与者和法规要求;封闭基准中的高分也不代表可直接接管车辆。

图:论文案例展示自车未来轨迹规划。

下一步:统一驾驶模型需要更严格的系统评测

下一步可把感知错误如何传到问答和规划做成链路分析:同一辆车漏检后,语言解释是否暴露不确定性,规划是否采取更保守轨迹。只有把模块间影响公开,统一架构的优势才能超过简单共享骨干。

实际部署还要测推理延迟、显存、功耗、传感器同步和故障降级。4B规模有利于压低计算门槛,但车端系统需要稳定的最坏时延和冗余控制;模型仓库与代码可以支持复现,安全结论仍要由独立道路测试给出。

统一模型还应报告校准能力。当视觉信息不足或道路遮挡严重时,问答分支能否承认不确定,规划分支能否同步减速,是比平均轨迹误差更接近安全需求的问题;两个分支若给出相互矛盾的置信度,系统必须进入保守模式。

数据组合也值得持续审计。通用图文数据帮助保留语言能力,但驾驶场景需要精确时间、位置和交通规则;训练时应防止宽泛语义信号压过小目标、车道边界和近距离交互等高风险细节。

代码和模型开放后,外部测试可以使用不同相机配置、地区道路和交通密度,复核共享表征是否稳定。对4B模型的评价最终要同时包含任务质量、最坏时延和故障恢复,而不只是模型规模较小这一项。

论文标题中的“初步探索”很重要。统一视觉语言基础模型提供了研究平台,但车辆控制仍需要确定性监控、地图与传感冗余、紧急制动和法规认证。后续每次模型更新都应通过固定安全场景回归,不能只看新版本平均分是否上涨。

在技术报告中,最好进一步公开闭环路线、碰撞率和舒适度的逐场景分布。平均规划分数无法说明模型在哪些转弯、汇入或施工区域最不稳定;按场景拆分结果,才能指导数据补充和安全降级规则。

参考资料

https://arxiv.org/abs/2609.00111

https://github.com/QwenLM/Qwen-Drive-1.0