主流视频生成模型通常先训练一个自编码器,把像素压进潜空间,再让扩散模型从头学习其中的语义。牛津大学与新加坡国立大学提出V-RAE,直接复用冻结视觉基础模型的表征来构建视频潜空间,使生成训练最多加快6倍,并在Kinetics-600上取得19.16的生成FVD。
视频自编码器既要还原细节,又要提供适合生成的表示。只追求像素重建时,潜变量会保留大量纹理噪声,扩散模型还得自己重新学会物体、动作和场景;完全依赖图像语义特征,又可能丢失时间连续性与细节。
冻结视觉大模型,把逐帧语义压成视频表征
V-RAE先用现成视觉基础编码器提取每帧特征,再通过时间池化把冗余相邻帧压缩为紧凑视频token。编码器保持冻结,训练重点放在时间聚合和视频解码器上。这样得到的潜空间从一开始就带有成熟的物体与场景语义,不必随生成模型重新摸索。
V-RAE利用冻结视觉编码器和时间池化构建视频潜空间。
视频解码器负责从语义表征恢复动作、纹理和连续帧。时间池化比例决定压缩效率与运动细节的平衡:压得越紧,扩散模型处理的token越少;保留得越多,快速动作和微小变化更容易重建。框架可以在不同基础视觉编码器与生成骨干之间组合。
用tFVD补上普通重建指标忽略的时间质量
团队指出,逐帧图像指标或传统重建FVD可能无法准确区分时间闪烁。为此提出tFVD,单独衡量重建视频在时间维度的稳定与动态保真。一个模型即使每帧都清晰,只要手的位置、物体纹理在相邻帧跳动,tFVD也会暴露问题。
V-RAE整体架构以及重建、生成两阶段训练方式。
在Kinetics-600上,V-RAE重建FVD达到2.13,说明高层视觉表征并未牺牲还原能力。用于无条件或类别条件生成时,论文报告UCF101的生成FVD为117.86、Kinetics-600为19.16。不同数据集规模与协议不同,数字应在各自基准内比较。
扩散模型收敛最多快6倍
语义更规整的潜空间让生成模型更快学到数据分布。论文观察到训练收敛最多加快6倍,这意味着在相同算力预算下可以更早获得可用样片,或把节省的训练量用于更大数据和更长视频。收益来自表示设计,而不是简单减少分辨率。
V-RAE在Kinetics-600上的视频生成样例。
tFVD揭示不同视频自编码器的时间重建差异。
冻结视觉编码器也带来清晰的工程边界:它继承基础模型擅长的语义,也会继承其数据偏好;极细文字、快速局部运动或罕见视觉领域仍需专门验证。但作为生成模型的“第一层地基”,V-RAE说明潜空间可以主动借用大规模视觉预训练,而非每次从像素重建重新开始。
下一步成为长视频与多任务生成的共享接口
V-RAE可以服务的不只是单一扩散模型。同一潜空间若同时接入文本生成、视频编辑、预测和理解任务,视觉基础模型的语义就能在多个方向复用。时间池化还为长视频提供了直接降token手段,适合进一步研究分层时间表示:短时层保留动作,长时层记录场景与事件。
未来可以加入音频、深度或光流,让潜变量兼顾语义和物理运动;也可在医学、机器人等领域替换专业视觉编码器。随着视频生成越来越受训练成本限制,V-RAE这种“先把表示学好,再训练生成器”的路线,有望成为降低实验门槛和加快模型迭代的重要基础组件。
这套表示还适合做分辨率与帧率的渐进训练。研究者可先在低成本潜变量上学习场景和大动作,再逐步增加时间密度与空间细节;冻结编码器让不同阶段的语义坐标保持一致,减少课程切换时重新适配。若与缓存和稀疏注意力结合,训练提速有机会延伸到分钟级视频。
评测方面,tFVD可以和人工时间一致性评价配套使用,并按运动速度、镜头切换和主体类型分组。这样既能看到总体数字,也能确认模型究竟是在慢动作、快速手部操作还是复杂相机运动上受益,为下一代视频自编码器提供更精确的优化方向。