arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

清华&长城汽车等提出SPVC:修好跨数据集驾驶视频里的结构错位

arXiv 2608.17420 cs.CV

自动驾驶仿真把相机移到训练轨迹之外,3D高斯溅射生成的道路、建筑和车道线容易变形;向场景插入车辆后,前景还可能与背景错位。清华大学人工智能产业研究院、浙江大学、长城汽车、上海交通大学等机构提出SPVC,用一套两阶段视频扩散模型修复跨数据集驾驶渲染。

SPVC的四个字母对应结构化、全景、视频和跨数据集四项设计:相机位姿、3D边界框和高精地图约束空间;背景与前景一起修;连续帧共同处理;同一网络覆盖NuScenes、Waymo和PandaSet。论文验证的是渲染后处理,不代表方法已进入真实车辆感知或决策系统。

新视角与场景编辑会制造两类伪影

3DGS擅长从已采集视角重建场景,但相机沿未见轨迹运动时,训练不足区域会出现模糊、空洞和结构拉伸。道路边缘与车道线尤其敏感,一帧的小偏差在视频里会变成持续抖动。

场景编辑带来另一类问题。把新车辆放进重建环境时,物体外观、尺度、遮挡和光照可能与背景不一致,前景在相邻帧间还会闪烁。已有修复方法多针对单张新视角图片或单独的物体编辑,很难同时处理背景结构与插入车辆。

SPVC先模拟欠约束3DGS渲染与3D资产插入,构造退化—干净视频对。训练数据明确包含需要修复的错误类型,模型学习的不是任意美化,而是把特定渲染伪影还原到参考场景。

第一阶段修外观,第二阶段校结构

第一阶段执行视频先验对齐。模型接收退化视频、参考视频和相机位姿,利用视频扩散骨干先恢复连续外观,减少闪烁、模糊与整体色彩偏移。视频序列共同输入,使相邻帧可以互相提供线索。

第二阶段进行结构化精修。3D边界框约束车辆位置与尺寸,高精地图约束道路和车道布局;这些条件进入冻结骨干上的可训练模块,降低模型凭视觉先验随意改造场景的概率。

SPVC两阶段框架

第一阶段对齐视频外观,第二阶段引入边界框和高精地图修正场景结构。

“全景修复”在这里指同时处理背景与前景,并非只提升全景图分辨率。背景包括道路、建筑和车道,前景主要是场景编辑引入的车辆;两者放在同一时序模型中,减少各自修好后边界仍不协调的问题。

一套网络跨三类驾驶数据工作

论文训练池包含NuScenes、Waymo和PandaSet,共168个场景、3449段视频。跨数据集训练迫使模型适应不同相机、城市外观与采集协议,也减少每换一个数据集就训练专用修复器的成本。

方法对比

论文定性对比检查道路结构、车辆外观和跨帧一致性是否同时改善。

作者从图像质量、视频一致性和结构控制等角度比较方法,并展示新轨迹、车道偏移和车辆插入案例。视觉改善不能单独证明几何真实;用于自动驾驶仿真时,还要检查修复是否改变物体位置、可行驶区域或传感器标签。

跨数据集并不等于跨所有道路。三套公开数据仍集中在特定城市、天气和相机系统,夜间、雨雪、施工与罕见交通参与者需要单独验证。视频扩散模型也可能生成看似自然但与原始几何不符的细节,结构条件只能降低这种风险。

跨数据集与零样本结果

零样本示例用于观察共享修复器迁移到未直接训练设置时的表现。

从渲染修复走向可核验仿真数据

SPVC可用于仿真内容生产:先用3D重建修改轨迹或插入车辆,再用视频修复改善画面,最后保留原有几何和标签供训练与测试使用。适用场景包括新视角回放、数据增强和可控交通事件合成。

落地前需要把“更像真”与“标签仍正确”分开验收。后续评价应加入深度、光流、3D框投影和地图一致性,并测量修复后训练感知模型是否真正受益。若模型只改善人眼观感,却移动了关键交通要素,它就不适合作为安全系统的数据源。论文已经提供跨数据集共享修复器,下一步是建立逐像素外的几何审计。

参考资料

https://arxiv.org/abs/2608.17420

https://li00147.github.io/SPVC-Project-Page/