arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

高通&密歇根大学给压缩计算补误差,DINOv3跑快1.5倍

作者:arXivDaily编辑部 arXiv 2610.02882 cs · cs.AI · cs.LG

论文导读

高通AI研究院、密歇根大学等机构提出DyRA,在压缩矩阵计算之后,按当前输入补偿输出误差。DINOv3实测端到端GPU加速1.5倍,相比只压缩权重的对照,精度退化减少超过3倍。视觉、语音和语言实验显示,省计算时检查实际输出,比只追求权重接近原版更有效。

权重压得像,输出不一定接近

神经网络的大量时间花在矩阵乘法上。用较小、结构更简单的矩阵近似原权重,可以省计算;但权重只差一点,遇到不同输入时,实际输出误差可能被放大。

DyRA把修正目标移到当前输出。先用已有的结构化权重计算一份近似结果,再根据当前输入估计遗漏的部分,把补偿加回来。它保留压缩计算的主要收益,同时针对这次输入修复误差。

这里的动态补偿发生在推理时,不能靠完整重算原矩阵才能得到误差,否则省下的计算会被抵消。团队使用较小的低秩表示近似补偿项,控制它的额外成本。

同样预算,补最影响这次输出的部分

静态压缩事先固定权重近似,所有输入使用同一份方案。DyRA根据输入变化估计剩余输出,因此某些对当前图像或语音重要的误差可以获得不同的补偿。

论文比较了低秩、Monarch、BLAST等结构化方案与加DyRA的版本。实验把计算预算对齐,检查改进来自输出修正,而不是偷偷增加到原模型同样多的运算。

视觉特征图使用统一的颜色投影方式显示压缩后的变化。原图、原模型和不同压缩方案并列,可以观察特征结构是否变得杂乱;颜色本身不是生成图像质量,也不能当作分类准确率。

图:三组输入图像与原模型、不同压缩方案的彩色特征对照。

DINOv3加速1.5倍,还要分开看精度

论文在DINOv3上报告端到端GPU加速1.5倍,精度退化相对只压缩权重的基线减少超过3倍。端到端结果比单独统计矩阵乘法更接近运行效果,但仍取决于硬件、批量和模型设置。

语音实验中,计算量减少50%时,低秩方案的词错误率为24.54%,加入DyRA后为4.89%;BLAST从6.48%降到4.27%。原模型为1.92%,所以补偿改善了压缩后的损失,未把所有差距消除。

语言实验在不微调的条件下比较困惑度,加入动态修正后多组数据集优于单独低秩近似。困惑度是预测文本的指标,不能直接外推成用户问答质量或统一延迟收益。

图:语义分割成绩随计算量削减变化的多种压缩方案曲线。

部署前把精度和真实耗时一起测

DyRA提供的是结构化压缩的补充计算方式,可继续检验在不同模型、任务和硬件上的收益。项目仓库给出实现,使用者能够在目标环境中测实际误差与端到端时间。

后续落地需要确定哪些层适合动态修正,以及补偿开销能否被目标设备有效执行。浮点运算减少不必然等于速度同比提升;把输入规模、任务精度和真实运行时间一起报告,才能判断是否值得部署。

图:DINOv3深度估计端到端延迟与任务精度的折中曲线。

参考资料

https://arxiv.org/abs/2610.02882

https://arxiv.org/html/2610.02882

https://github.com/daewon88/DyRA

↑