arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

扩散模型少算19.3%画质还更稳,阿里云等用不确定性管缓存

作者:arXivDaily编辑部 arXiv 2609.05981 cs · cs.CV · cs.LG

论文导读

上海交通大学、阿里云终端智能计算部、复旦大学联合提出GP-Refiner,为扩散Transformer缓存增加在线误差校正和不确定性开关。它与TaylorSeer组合后,在论文设置中减少19.3%计算量,PSNR提高0.9 dB,LPIPS从0.46降到0.29。收益来自指定模型、缓存方案和实验条件,不能直接换算成终端生成速度。

缓存省下重复计算,也会把误差一路传下去

扩散模型要连续执行多个去噪步骤,相邻步骤的中间特征往往很像。特征缓存会在部分步骤复用或预测旧特征,跳过昂贵的Transformer计算。问题是,预测特征与完整计算轨迹之间存在偏差;跳过次数越多,偏差可能累积,最后影响图像或视频质量。

常见做法按固定间隔重新完整计算,或训练一个额外模型修正误差。固定间隔不知道当前样本是否真的需要重算;监督修正则需要在加速过程中同时拿到完整计算结果,这会抵消省下的成本。

图1:论文主图对比原始缓存管线与GP-Refiner;后者根据后验方差决定接受预测还是触发完整计算。

用刚刚完成的计算步估计误差分布

论文观察到,缓存方法在完整计算步骤产生的特征残差,在局部范围内近似零均值高斯分布。团队把这些完整计算特征视为带噪观测,用高斯过程回归在线估计参考轨迹。这样,校正器不需要额外生成每一步的完整标签,而是利用本来就会执行的校准步骤更新。

高斯过程还能给出后验方差。方差低时,系统接受缓存预测;方差超过阈值时,执行一次完整计算,并把新观测用于后续校正。计算预算由固定时间表改成“哪里不确定,哪里重算”。

图2:论文比较图展示多种缓存方法在汽车、狗、披萨和水果等样例上的生成结果及计算倍率。

少算19.3%,PSNR反升0.9 dB

GP-Refiner是可插接模块,论文把它接到不同扩散模型和缓存方法上。与TaylorSeer组合时,计算量减少19.3%,PSNR提高0.9 dB,LPIPS从0.46降到0.29。PSNR越高通常表示像素更接近完整计算参考,LPIPS越低则代表感知差异更小。

图3:论文高斯过程示意展示观测误差分布、均值与不确定性范围,方差用于控制是否重算。

这里比较的是加速结果与参考生成轨迹,不是对照片真实度的独立评价。19.3%是计算量变化,也不必然等于延迟降低19.3%;在线回归、内存访问和硬件并行都会影响实际耗时。不同采样步数和模型结构也可能改变误差是否接近论文观察到的分布。

下一步看端到端延迟和长期稳定性

这类不确定性开关可用于图像、视频和其他多步生成任务,让模型在简单区域多复用,在快速变化处主动校准。产品化评测应同时报告墙钟延迟、显存、功耗、吞吐和失败样本,并测试阈值在不同分辨率与提示词下是否稳定。若校正器本身需要频繁重建或占用大量内存,理论计算节省可能无法变成用户等待时间。把不确定性日志暴露出来,也有助于定位哪些生成步骤最容易让缓存失真。

参考资料

https://arxiv.org/abs/2609.05981

https://arxiv.org/html/2609.05981