arXivDaily arXiv每日学术速递 周一至周五更新
海上生明月,天涯共此时!祝大家学得开心,也要注意身体~~

PAPERDAILY REPORTS

边缘CPU跑视觉模型,近乎不掉精度平均快1.81倍

作者:arXivDaily编辑部 arXiv 2609.28262 cs · cs.CV · cs.LG · cs.PF

论文导读

巴塞罗那超级计算中心、加泰罗尼亚理工大学系统测试了13种混合精度量化敏感度指标。梯度方法在8个模型-硬件配置中4个发生灾难性失败,Jensen-Shannon散度则为零;再配合K-Means分组,方案在近乎无精度损失下平均加速1.81倍。

不是每一层都适合压成INT8

边缘CPU上的视觉模型同时受到算力、内存和能耗限制。把32位浮点计算改成8位整数可以加快推理,但不同层对量化误差的承受力差异很大。全部层都量化可能严重掉精度;保留层太多,加速又会消失。

工程上常用“敏感度指标”估计某层量化后会损失多少,避免枚举所有混合精度配置。问题是,过去常用的梯度和权重统计指标在现代网络上不稳定,它们挑出的低风险层未必真的安全。

图:端到端加速图对比ConvNeXt Tiny、EfficientNet-B0、ResNet-18和TinyViT在多种CPU架构上的不同量化方案。

13种指标同场测,失败次数差很多

研究者比较13种层级INT8敏感度指标,覆盖四个结构差异明显的视觉网络,再把实际配置放到两个ARM64平台验证。梯度类方法在8个模型-硬件组合中有4个出现灾难性失败,权重统计方法有2个,Jensen-Shannon散度没有出现灾难性失败。

敏感度排名只回答“哪些层更怕量化”,却没有告诉系统应该在哪里切一刀。现代网络的敏感度分布往往很偏,一个固定阈值很难同时适配不同网络。RAMP用K-Means自动把层分组,根据当前模型的分布决定哪些层保留高精度。

未来落地:保留低收益层,反而可能更慢

一个反直觉结果是,某层单独改成INT8时加速很小,不代表应该把它留在浮点。混合精度切换会拆碎计算图,让原本能合并的算子无法融合。有时多保留一个看似收益很小的层,会因为断开前后算子而拖慢整个网络。

图:条形图将其他内核与破坏融合的深度卷积延迟分开,展示少量层切换也会拉高平均推理耗时。

最终,K-Means策略在近乎无精度损失的条件下,相对全精度模型平均加速1.81倍。这个平均值来自四个网络和两个ARM64平台,不代表每一种CPU、编译器和模型都能达到1.81倍。

图:项目预览页标明RAMP针对边缘CPU视觉模型的鲁棒自适应混合精度量化。

后续落地需要把这种层级分配与具体编译器、算子库和实际热功耗联合评估。对开发者来说,论文更实用的结论不是某个固定阈值,而是量化决策必须同时看精度敏感度和整张计算图的融合效果。

在边缘设备上,平均延迟只是部署指标之一。峰值内存、持续运行后的降频、能耗和不同输入尺寸下的尾延迟都会影响真实体验。RAMP的结果来自四个视觉网络与两个ARM64平台,说明方法跨过了若干架构差异,但还不足以覆盖手机、车载和微型计算板上的全部编译栈。团队若把层级分配纳入部署流水线,还需在每次模型或运行库升级后重新测量,不能永久复用一次敏感度排序。

参考资料

https://arxiv.org/abs/2609.28262

https://github.com/davidpob99/ramp-mpq

↑