论文导读
北京大学、清华大学与阿里巴巴集团等机构联合推出视频扩散加速方案SparkDiffusion,攻克了长视频生成中的计算瓶颈。研究团队针对Wan2.1开源大模型设计动态稀疏路由与误差自校准机制,在保持画面完整的前提下剔除多达97%的冗余计算。单张消费级RTX 5090显卡生成高分辨率视频耗时从近80分钟直降至18秒,整体端到端推理提速高达265倍。
显存与算力死结:14B视频模型为何单卡难跑
基于扩散架构的视频生成模型在画面保真度和时空连贯性上进展迅速,但算力开销极大。以开源的Wan2.1为例,其14B参数模型生成720P、81帧长视频时,单张RTX 5090显卡端到端耗时高达4769秒,相当于需要漫长等待79分钟以上。即便是顶级的H100计算卡,完成相同任务也需要1757秒。
以往尝试通过稀疏化注意力降低计算量,但在实际中常遭遇高稀疏陷阱。当注意力稀疏度拉高到80%以上时,单步训练损失虽然正常,但经过数十步扩散迭代,特征偏差持续累积,导致画面后半段严重崩坏、肢体畸变或纹理溃散。
图:在H100与RTX 5090显卡上测试Wan2.1各尺寸模型端到端生成耗时与加速倍数
攻克高稀疏陷阱:三阶段自适应动态路由
为了打破高稀疏度下的误差滚雪球困境,联合团队分析了去噪过程中时空令牌的信息分布。在低噪声阶段,背景与平滑区域注意力高度聚类,动作关键区则集中在少数高响应通道上。SparkDiffusion据此构建三阶段流水线,根据去噪阶段动态调整稀疏策略。
方案先通过残差预估器识别当前去噪步的关键特征,再用时空自适应路由网络剔除无关令牌与遮挡区域,将全局注意力计算压缩至仅占原规模3%的核心区,配合量化加速内核实现极高访问效率。
图:框架涵盖特征残差预测、自适应稀疏路由以及量化注意力三项核心机制
真实测试表现:画质毫发无损,单卡秒级出片
在消融与对比实验中,SparkDiffusion展现出优秀的加速与画质保持水平。对于14B参数的Wan2.1模型,在720P分辨率下,将稀疏度拉满至97%时,生成视频在VBench综合评测中的指标几乎与全注意力基线重合,人物轮廓、发丝流动及雨夜反光等细节均未受损。
图:Wan2.1在97%注意力稀疏度下与全注意力原始模型及基线方法的视觉细节对比
耗时变化更为显著。在RTX 5090单卡上,Wan2.1-14B生成时间从4769秒暴跌至18秒,提速达到265倍;在H100上生成耗时由1757秒降至92秒,提速超19倍。
图:不同去噪步数下均匀稀疏、静态阈值与动态稀疏策略的特征误差累积走向
从误差累积曲线可以看出,静态阈值方案在20步后误差迅速抬头,而SparkDiffusion将累积方差压制在安全范围内,实现加速不掉点。
算力门槛打破之后:本地化内容创作与工业落地
SparkDiffusion为百亿参数开源视频模型的普及扫清了障碍。以往需要计算集群才能承担的720P高质量短片制作,现在依托单张消费级显卡即可近实时完成,显著缩短了影视预览和内容创作的等待周期。
研究团队指出,下一步将探索把动态稀疏路由理念拓展至视频交互编辑与实时流式生成,进一步优化模型在端侧设备上的显存占用,让更大规模的视频基础模型走入日常工作流。