论文导读
Nunchux AI、麻省理工学院、卡内基梅隆大学和英伟达提出无需训练的VC-Attention,专门压缩视频扩散模型最耗时的注意力计算。其内核在工作站GPU上比BF16 FlashAttention-4快2.3至3.6倍,但完整视频生成只提升1.36至1.70倍,不能把内核数字等同于整机速度。
低比特为什么仍会又慢又糊
视频扩散Transformer要处理很长的时空序列,注意力计算很快成为主要成本。把查询、键和值压成低比特,理论上能让张量核心跑得更快,现实却有两道坎:值张量里少数极端数会撑大量化范围,普通数因此挤在很窄的刻度里;两次矩阵乘法之间的Softmax仍要做高精度指数运算,反而成了最长的流水阶段。
论文图:离群值与高精度Softmax共同限制低比特注意力的画质和速度。
过去不少方法主要平滑查询和键,但值离群值并不固定在某个通道或某段时间,难以靠一组静态缩放系数解决。VC-Attention把精度问题和内核问题一起处理,而不是只降低存储位宽。
先重排值,再把概率直接铸成FP8
第一部分V-Smooth在线把值令牌轻量聚类并重排,让同一硬件块中的数据范围更接近。它只量化减去块均值后的残差,均值则从在线Softmax已维护的行和中恢复,因此不需要额外训练模型。
论文图:值令牌按相似范围组织并去除块均值,以降低量化误差。
第二部分ExpCast-FP8把对数域分数通过一次融合乘加直接映射到E4M3概率编码,避开FP32指数和格式转换。两部分配合后,低比特矩阵乘法之间不再被高精度步骤拖住,作者也为多代数据中心和工作站GPU实现了对应内核。
从B200到RTX 5090分别测
实验覆盖Wan2.2、LongCat-Video、HunyuanVideo-1.5和MiniMax-H3,以及B200、B300、H200、RTX PRO 6000和RTX 5090。论文报告,VC-Attention在测试模型上比其他低比特基线更接近BF16画质;注意力内核在数据中心GPU上加速1.46至1.59倍,在工作站GPU上加速2.3至3.6倍。
论文图:视频生成连续帧样例用于检查低比特计算后的时序与细节保真度。
端到端结果更能反映用户体验:数据中心GPU上的完整片段生成提速1.13至1.19倍,工作站GPU为1.36至1.70倍。其余去噪网络、数据搬运和调度并未一起消失,所以标题中的3.6倍必须理解为特定内核峰值。
这种差距也说明,内核优化越成功,系统里的下一个瓶颈越快暴露。评估时应同时记录单次注意力、完整去噪步骤和整段视频三层耗时。
下一步看更长视频和真实工作流
VC-Attention的吸引力在于无需重新训练,理论上更容易加入现有视频生成服务。真正落地仍要观察不同分辨率、帧数、批量大小和显存压力下的收益,以及画质指标之外的运动稳定性。若能在开源推理框架里稳定复现,工作站显卡生成长视频的等待时间会先受益。