arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

浙大、清华等把190亿参数音视频生成提速54.67倍,单张H20从318秒降到5.83秒

作者:arXivDaily编辑部 arXiv 2608.24674 cs · cs.CV

输入一句文字,同时生成画面和匹配的声音,省掉了视频生成后再配音的串联步骤,但联合模型也把两种模态的计算成本叠到一起。浙江大学、清华大学、新加坡国立大学等机构提出TurboT2VA,用蒸馏与推理优化加速190亿参数的LTX-2音视频模型。

在1024×1792部署设置、单张NVIDIA H20上,论文把生成器延迟从40步教师的318.74秒降到4步学生的5.83秒,报告54.67倍提速。这个数字只覆盖生成器,不包含文本处理、视频编码、文件传输和产品排队。

联合生成不能只把视频蒸馏方案照搬过来

视频与音频的损失尺度、收敛速度和质量评价不同。直接联合训练时,梯度更强的一侧会主导更新;一致性训练能减少步数,却容易在大模型上数值不稳;只追求分布匹配又可能让样本变得相似。TurboT2VA先对两种模态分别归一化,再按阶段改变训练目标。

论文Figure 1:视频与音频双流、三阶段蒸馏、4步学生模型和单卡推理加速组成完整方案。

第一阶段用离散一致性预热,建立稳定起点;第二阶段转为连续时间一致性,让学生学习教师轨迹并保持样本差异;第三阶段加入分布匹配,集中改善感知质量。训练顺序固定为先稳定、再扩展轨迹、最后压实画质和声音。

40步教师被压成4步学生

一致性模型学习从不同噪声时刻直接指向结果,因此可以跳过大量逐步去噪。论文又加入分数正则,避免学生只记住有限教师样本。视频和音频保留各自的自注意力,同时维持密集的跨模态通路,让画面事件与声音事件继续交换信息。

论文方法图:一致性目标负责少步推理,分布匹配负责收紧感知质量,两者按课程逐步结合。

在512×768标准评测分辨率下,4步蒸馏把生成器延迟从50.52秒降到2.51秒,提速20.1倍。论文同时比较视觉质量、音频保真、文本对齐、多样性和音视频同步,学生模型在多项指标上接近教师,但并非每个单项都全面超过40步版本。Figure 4另用画面、波形与频谱并排展示TurboT2VA和LTX-2的定性差异。

论文Figure 4:TurboT2VA与LTX-2在相近提示词下的画面序列、音频波形和频谱对比。

54.67倍还包含一套硬件感知推理栈

少步蒸馏并不是全部速度来源。高分辨率部署还使用受保护的W8A8线性算子、融合内核、文本填充压缩和模态感知稀疏注意力。视频与音频内部可以稀疏计算,跨模态和文本条件路径保持密集,避免速度优化直接切断同步信息。

完整链路中,未优化的4步学生需要16.50秒;加入推理栈后降到5.83秒,推理优化再贡献约2.83倍。54.67倍是相对318.74秒的40步教师计算,硬件、分辨率、批量大小和实现版本都必须与论文一致。

论文Figure 7:直接联合目标与分阶段课程的训练曲线,展示稳定性和质量—多样性差异。

下一步:代码公开后复现整条速度链

团队已经公开推理代码、权重获取说明和多组教师—学生演示。对于创作工具,4步联合生成可以缩短试错周期,也减少视频与后配音在节奏上对不齐的问题。

下一步需要在更多显卡、提示类型和长视频上核对速度与同步质量,并测量完整端到端等待时间。单段生成器5.83秒还不等于用户5.83秒拿到成片;音频解码、视频编码、显存调度和并发请求会决定真正的产品体验。

复现时还应分别记录蒸馏、量化、融合内核和稀疏注意力带来的增益,并公开相同提示词、随机种子和输出时长下的质量变化。这样才能判断54.67倍中哪些部分能迁移到其他硬件,哪些依赖H20与论文实现的组合。

参考资料

https://arxiv.org/abs/2608.24674

https://arxiv.org/html/2608.24674

https://github.com/thu-ml/TurboDiffusion/tree/main/turbot2va