论文导读
北京大学、清华大学、阿里巴巴等机构提出SparkDiffusion,把视频扩散的稠密注意力改成97%稀疏,并把50步生成压到3步。在Wan2.1 14B的720P测试中,单张RTX 5090端到端最高加速265倍,1.3B模型生成480P视频的去噪时间降到1.3秒。
视频扩散最贵的部分,被压缩到只算3%
视频模型要同时处理时间和空间上的大量Token,注意力计算随序列长度快速增长。直接删掉大部分连接看似简单,但稀疏率越高,模型越容易在早期把人物结构、镜头布局和大尺度运动定错,后续步骤再精修也拉不回来。
SparkDiffusion把问题拆成三个动作:先用短时间训练让稀疏结构学会粗略生成,再用混合轨迹蒸馏纠正最终输出,最后加入FP8量化和融合算子。它不是只减少一次计算,而是同时减少每一步要算的连接和总去噪步数。
图:真实轨迹、50步教师、50步稀疏模型与4步SparkDiffusion在六类形状上的生成结果对比。
为什么训练损失更低,成片反而不一定更好
团队把极高稀疏率下的停滞称为“高稀疏陷阱”。逐步训练只要求每个局部去噪动作接近教师,但最终画面误差是几十步偏差共同累积的结果。论文发现,关键错误集中在高噪声的结构生成阶段;继续延长局部训练,损失还会下降,最终视觉质量却可能不再改善。
因此第二阶段直接对齐终点分布,并混入少量完整生成轨迹。这个设计让模型先拥有可用的稀疏粗先验,再专门修正会传到成片的结构偏差。消融结果显示,只做稀疏预热或只追逐局部损失,都无法获得同样的终局质量。
图:H100与RTX 5090上,不同Wan模型的稠密基线和SparkDiffusion端到端延迟对比。
265倍对应哪组实验
最醒目的265倍来自Wan2.1-T2V-14B-720P:单张RTX 5090上,3步、无分类器引导的SparkDiffusion与50步稠密基线比较。H100上的对应加速为220倍。对Wan2.1-T2V-1.3B-480P,论文报告去噪耗时1.3秒;这些数字不能直接外推到视频编码、排队和产品接口的全部等待时间。
画质评测同时覆盖Wan2.1、Wan2.2,包含文生视频和图生视频。团队报告在长序列720P任务上维持97%注意力稀疏,在1.3B的480P任务上采用90%稀疏。比较图显示,方法试图保留主体、背景和动作连续性,而非单纯追求吞吐。
图:稠密模型、其他快速方案与SparkDiffusion在相同提示下的多组视频帧质量对比。
从论文速度走向生成服务
下一步要看两类数据:一是不同显卡、分辨率和视频长度下能否稳定复现加速;二是接入真实服务后,显存占用、首帧时间和并发吞吐能否同步改善。论文已经给出融合内核和多种骨干上的结果,工程价值在于把“少算注意力”和“少跑扩散步”放进同一条单卡推理链路。
参考资料
https://arxiv.org/abs/2609.23153
https://arxiv.org/pdf/2609.23153