arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

清华等把生成式视频压缩做到实时:码率少58%,720p跑到13帧

作者:arXivDaily编辑部 arXiv 2609.02291 cs · cs.AI · cs.CV

论文导读

清华大学、哈尔滨工业大学(深圳)、北京大学等机构联合提出VoRTeC,用Wan2.1流模型的生成先验做超低码率视频压缩。论文报告其相对既有扩散式方案减少58%比特消耗,720p解码达到13 FPS、480p达到32 FPS;速度与画质结论来自指定硬件、数据集和基线,不能直接视为所有终端表现。

超低码率下,模糊和延迟通常只能选一个

传统神经视频压缩在比特不足时容易抹掉纹理,生成式压缩可以补出更自然的细节,却常要运行多轮扩散或去噪,解码慢且相邻帧可能闪烁。VoRTeC试图把生成模型的画面先验保留下来,同时把最耗时的迭代过程压成一步。

项目对比图把原始视频、传统方案和VoRTeC重建放在相同码率附近。赛马服装、草地和快速运动边缘等局部能直接观察到差异;这些是定性案例,不能替代跨视频的平均指标。

图:项目页展示原始帧、基线与VoRTeC在低码率下的重建细节。

先压潜变量,再定位流轨迹中的状态

系统先把视频编码为紧凑潜变量,按不同粒度切分并量化。随后不从纯噪声反复去噪,而是估计压缩表示位于预训练流轨迹的哪个时间状态,让Wan2.1的FlowDiT一步完成重建。预训练流网络本身不需要开放参数或梯度。

多尺度先验负责兼顾结构和细节。为减少跨组跳变,系统复用上一组尾帧并缓存先验,让下一组从已有上下文继续解码。该设计针对的是帧组之间的连续性,而非只优化单帧观感。

图:项目架构图展示潜变量压缩、流状态估计和单步生成重建。

720p达到13 FPS,480p达到32 FPS

论文汇总结果显示,相比此前扩散式视频压缩方法,VoRTeC的比特消耗减少58%,解码速度提高3至197倍。最终速度为720p每秒13帧、480p每秒32帧;“实时”在这里对应论文的解码测试,不包含网络传输、编码和播放器缓冲。

图:项目页定量图比较多种方法的率失真表现和解码效率。

延迟表还区分解码和编码吞吐量,说明两端成本并不相同。面向视频会议或云游戏时,端到端延迟要把采集、编码、传输、解码和显示都算进去,单看解码帧率不足以判断产品体验。

图:项目页列出不同分辨率下的编码与解码吞吐量。

从论文速度走向真实部署

下一步应在不同硬件、视频类型和运动强度上报告能耗、显存、首帧时间与长视频稳定性。生成式重建还需要单独检查文字、人脸、细线条和快速镜头中的错误,因为“看起来真实”不保证恢复的是原始细节。

若用于实时通信,接收端还要处理丢包、码率波动和随机访问。把这些条件纳入公开测试,才能判断单步流模型是否在网络变化时仍能保持画质与帧间一致,而不是只在离线固定码率数据上占优。

参考资料

https://arxiv.org/abs/2609.02291

https://darc8-sun.github.io/VoRTec_compress/