同一笔训练预算,是把驾驶视频模型做得更大,还是让现有模型多看几遍数据?法雷奥AI与索邦大学的研究团队提出VATIX缩放研究,覆盖从100万到约90亿参数的视频扩散模型,并在最高5500小时驾驶数据上改变训练曝光量,得到一组面向固定数据池的缩放规律。
论文的直接结论是:有限算力下,增加训练曝光比单纯增大模型更快降低验证损失;算力和数据足够时,更大的模型仍能达到更低的最终损失。前半句不能缩写成“模型越小越好”,后半句也不等于盲目堆参数。
驾驶视频没有网页文本那样的数据自由
语言模型可以从大规模公开文本中持续扩展语料,驾驶视频要受采集成本、隐私处理、传感器配置和道路覆盖约束。车队拍到的素材数量有限,而且同一段道路在天气、交通和相机参数变化后,分布也会改变。训练团队必须先回答固定语料能重复利用到什么程度。
研究使用VATIX模型族:视频先由VAE压缩成潜变量,时空Transformer接收噪声潜变量、文本条件、相机轨迹和首帧条件,再通过流匹配目标学习后续画面。所有模型从头在驾驶数据上训练,避免把网络视频预训练带来的先验混入缩放曲线。
图1:VATIX在潜空间生成驾驶视频,并接收首帧、文本和相机轨迹条件。
先固定模型,看多训练几遍有多大收益
团队为不同规模模型改变数据曝光量,即训练过程中实际处理的样本总量。验证损失随曝光量呈稳定幂律下降,拟合指数约为0.74;对固定模型而言,多训练带来的改善速度明显快于只增加参数量。
图2:不同模型规模下,验证损失随训练曝光增加保持一致下降趋势。
这里的“多训练”不是无限重复。曲线在更高曝光量下仍会趋缓,固定数据中的新信息不会凭空增加。论文讨论的重点是预算分配:若模型尚未把现有5500小时素材学充分,把算力先花在延长训练上,比立刻换成更大模型更划算。
大模型仍有更低的最终损失
模型规模从100万参数扩到约90亿参数时,验证损失也遵循幂律,但模型规模方向的拟合指数约为0.21,下降速度弱于训练曝光方向。较大模型的渐近损失更低,在长时间训练后仍能拉开差距,因此研究团队没有得出“停止扩模”的结论。
图3:参数量增大仍降低最终损失,但在已测区间内收益增长慢于训练曝光。
基于拟合曲线,团队训练约90亿参数的VATIX,并在公开驾驶视频生成比较中报告更好的FVD与感知质量。论文称其为从头使用驾驶数据训练的最大视频扩散模型之一;这类比较受数据、分辨率、时长和评测协议影响,不能扩展成所有世界模型的全面排名。
下一步:让缩放规律连接驾驶指标
把模型大小和训练曝光放到同一张计算量曲线上后,最优点会随预算移动:小预算优先把较小模型训练充分,预算上升后再同步增加模型规模。若数据池不再扩展,最优模型增长速度会放缓,因为更大网络最终仍受有限数据约束。
图4:计算最优曲线给出不同预算下模型规模与训练曝光的组合。
下一步应在更多城市、天气、相机和长视频设置上复测这些指数,并把验证损失与自动驾驶真正关心的几何一致性、可控轨迹和稀有事件覆盖联系起来。对训练团队而言,这套方法可以先用于制定实验矩阵:在购入更多算力或扩充车队数据前,量化现有模型究竟是参数不足、训练不足,还是数据多样性已经触顶。
同样重要的是公开重复曝光的采样策略:若高频道路片段被反复看到,而稀有场景没有同步增加,损失下降未必会改善长尾事件生成。把数据去重、城市覆盖和训练能耗一起报告,才能判断最优点是否真的可迁移。
参考资料
https://arxiv.org/abs/2608.28404
https://arxiv.org/html/2608.28404