论文导读
高通AI研究院、密歇根大学等机构提出DyRA,在压缩矩阵计算之后,按当前输入补偿输出误差。DINOv3实测端到端GPU加速1.5倍,相比只压缩权重的对照,精度退化减少超过3倍。视觉、语音和语言实验显示,省计算时检查实际输出,比只追求权重接近原版更有效。
权重压得像,输出不一定接近
神经网络的大量时间花在矩阵乘法上。用较小、结构更简单的矩阵近似原权重,可以省计算;但权重只差一点,遇到不同输入时,实际输出误差可能被放大。
DyRA把修正目标移到当前输出。先用已有的结构化权重计算一份近似结果,再根据当前输入估计遗漏的部分,把补偿加回来。它保留压缩计算的主要收益,同时针对这次输入修复误差。
这里的动态补偿发生在推理时,不能靠完整重算原矩阵才能得到误差,否则省下的计算会被抵消。团队使用较小的低秩表示近似补偿项,控制它的额外成本。
同样预算,补最影响这次输出的部分
静态压缩事先固定权重近似,所有输入使用同一份方案。DyRA根据输入变化估计剩余输出,因此某些对当前图像或语音重要的误差可以获得不同的补偿。
论文比较了低秩、Monarch、BLAST等结构化方案与加DyRA的版本。实验把计算预算对齐,检查改进来自输出修正,而不是偷偷增加到原模型同样多的运算。
视觉特征图使用统一的颜色投影方式显示压缩后的变化。原图、原模型和不同压缩方案并列,可以观察特征结构是否变得杂乱;颜色本身不是生成图像质量,也不能当作分类准确率。
图:三组输入图像与原模型、不同压缩方案的彩色特征对照。
DINOv3加速1.5倍,还要分开看精度
论文在DINOv3上报告端到端GPU加速1.5倍,精度退化相对只压缩权重的基线减少超过3倍。端到端结果比单独统计矩阵乘法更接近运行效果,但仍取决于硬件、批量和模型设置。
语音实验中,计算量减少50%时,低秩方案的词错误率为24.54%,加入DyRA后为4.89%;BLAST从6.48%降到4.27%。原模型为1.92%,所以补偿改善了压缩后的损失,未把所有差距消除。
语言实验在不微调的条件下比较困惑度,加入动态修正后多组数据集优于单独低秩近似。困惑度是预测文本的指标,不能直接外推成用户问答质量或统一延迟收益。
图:语义分割成绩随计算量削减变化的多种压缩方案曲线。
部署前把精度和真实耗时一起测
DyRA提供的是结构化压缩的补充计算方式,可继续检验在不同模型、任务和硬件上的收益。项目仓库给出实现,使用者能够在目标环境中测实际误差与端到端时间。
后续落地需要确定哪些层适合动态修正,以及补偿开销能否被目标设备有效执行。浮点运算减少不必然等于速度同比提升;把输入规模、任务精度和真实运行时间一起报告,才能判断是否值得部署。
图:DINOv3深度估计端到端延迟与任务精度的折中曲线。
参考资料
https://arxiv.org/abs/2610.02882