中国科学技术大学、理想汽车和新南威尔士大学的研究人员联合提出了MOJITO,一个统一的端到端自动驾驶框架。它去掉了主流方案里「感知先压缩、规划后解码」的两级接口,让动作、图像、激光雷达特征在块级模态联合注意力中同步更新。在NAVSIM v1的navtest划分上,MOJITO取得88.9 PDMS,超过DiffusionDrive的88.1和ReCogDrive的86.5;在更难的NAVSIM v2上以88.4 EPDMS刷新纪录,对比方法DiffusionDriveV2为85.5。
两级流水线丢掉了什么
端到端自动驾驶的通行做法是级联:感知模块先把多模态传感器输入压成一个紧凑上下文,规划器再以这个上下文为条件预测轨迹。问题出在接口上——压缩是有损的,规划需要的细粒度信息可能在压缩时已经被丢掉;规划器被锁死在压缩表示上,也用不上现代视觉基础模型提供的丰富表征。
MOJITO的改动直指接口本身。它用块级模态联合注意力同时更新动作、图像和点云特征,动作生成过程中每一步都能直接访问多模态特征的原始形态,不再是「先给结论再问细节」。
架构落在统一的Transformer里:图像块、LiDAR块、动作块共享同一套模态联合注意力,各自带模态特定的嵌入与位置编码。论文把MOJITO描述为三分支的统一多模态框架——图像分支、点云分支和动作分支在块级注意力里互相可见,这是它敢去掉级联接口的前提。轨迹通过扩散过程直接参数化在这个架构内,不依赖预定义锚点,也不挂重监督的辅助头。
图:MOJITO的整体架构。图像、LiDAR与动作进入同一Transformer,经块级模态联合注意力同步更新,轨迹由扩散过程生成(论文Figure 2)。
双榜成绩单
NAVSIM v1 navtest上,MOJITO的88.9 PDMS领先DiffusionDrive(88.1)、WoTE(88.3)、ReCogDrive(86.5)。值得注意的是对比条件:ReCogDrive需要强化学习才把成绩从86.5推到90.8,MOJITO不使用视觉语言模型、不使用强化学习管线,纯监督设置下已经站上同一梯队。NAVSIM v2 navtest上,88.4 EPDMS对DiffusionDriveV2的85.5、ARTE-MIS和DriveSuprim的83.1,领先幅度更明显。
跨境场景的泛化另有单独测量:在跨模态评估中MOJITO拿到29.0 EPDMS,超过GuideFlow的27.1、DiffusionDrive的24.2和LTF的23.1。
图:多视角图像与BEV表示的对照示例,展示模态联合学习保留的细粒度信息(论文Figure 4)。
定性对比:弯道与汇入
定性结果里能看到统一接口的收益。弯道和汇入这类需要精确感知车道几何的场景,级联方案的轨迹在曲率突变处出现偏移,MOJITO的轨迹贴着车道走。扩散式规划带来的另一处差异是轨迹的多模态性:同一场景可以采样出变道与保持两种合理轨迹,而不是一条平均化的折中路线。
图:NAVSIM v1上的定性对比。MOJITO与DiffusionDrive、SSR等方法的轨迹差异(论文Figure 3)。
模态联合注意力的内部行为也有对应证据:注意力图显示动作块在生成过程中持续回看图像与点云的局部区域,而不是一次性消费压缩向量。
图:各Transformer块的模态联合注意力图,动作生成持续访问图像与LiDAR特征(论文Figure 5)。
从榜单到落地还有几步
MOJITO的统一架构对量产方案是直接相关的信号:不依赖VLM和RL意味着训练管线更简单、成本更低,缺失的分数可以从RL补——论文自己也援引了ReCogDrive加RL到90.8的路径。
边界条件同样要交代:NAVSIM是开环仿真基准,PDMS类指标衡的是轨迹质量而非闭环控制;实车部署还要过多传感器同步、时延和功能安全认证等工程关。论文也说明,加RL的路径并未堵死,只是这套架构不靠它也能站住。理想汽车的参与让这套架构距离量产验证更近一步,后续值得盯的是闭环指标与实车数据。理想汽车的参与让这套架构距离量产验证更近,下一步值得关注的是闭环测试和实车数据上的表现。