论文导读
巴基斯坦国立科技大学、FAST-NUCES大学联合提出FORGE,让已经量化并部署到微控制器的视觉模型只靠前向计算适应模糊、噪声和光照变化。适配21层中的3层即可恢复93%的收益,在ESP32-S3上额外耗能8.3毫焦、耗时21.9毫秒;数字来自指定int8模型和测试设置。
量化部署会把常用适应接口折叠掉
视觉模型在干净训练图像上表现正常,到了现场可能遇到传感器噪声、运动模糊和光照变化。服务器模型可以反向传播更新参数,微控制器常用纯整数推理运行时,既没有梯度计算,也会把批归一化层融合进前面的卷积。
很多仅前向适应方法依赖批归一化统计。层被融合后,这些统计不再作为独立模块存在,方法即使不做反向传播,也没有可直接更新的位置。FORGE针对的是已经完成BN融合和int8量化的卷积网络。
图:论文主图展示BN融合导致适应失效、逐通道重校准和ESP32-S3实测三步。
每个通道重新对齐干净训练统计
方法保存训练阶段每个通道的干净目标统计。测试图像到来后,FORGE只用前向输出估计当前分布,再把融合卷积的各通道输出重新归一化到训练目标附近,不修改原始卷积权重,也不需要恢复完整批归一化层。
激活分布图显示,受污染输入会让通道响应相对干净数据发生偏移;重新校准后,分布向训练状态靠拢。该图解释机制,不代表所有通道都要处理,论文随后专门测试了选择少数层的效果。
图:论文激活图比较干净输入、受污染输入与FORGE重校准后的单通道分布。
只适配3层,恢复93%的收益
完整FORGE恢复20.9个百分点准确率,梯度式TENT在对应比较中恢复24.9点。团队还发现,只处理21层中的3层就能保留完整方法93%的收益;层的选择不使用测试污染数据,避免针对评测条件临时挑选。
图:论文曲线展示适配层数增加时的恢复收益,3层位置标出约93%收益。
实验覆盖3个数据集、最多200个类别和2种网络架构,并验证了比特精确的int8卷积执行。单样本连续输入时,方法按批大小调整更新动量,不要求把多张现场图像先攒成一个批次。
在ESP32-S3上,前向适应围绕int8卷积做轻量fp32重校准,额外耗能8.3毫焦,占一次推理能耗6.8%;额外耗时21.9毫秒。这个成本不包含其他传感器、通信和应用逻辑,也会随模型结构和芯片实现变化。
向长期设备部署扩展
下一步需要测试连续环境变化下的稳定性。设备从白天进入夜间时应快速适应,回到正常光照后又不能遗忘干净分布;若输入连续包含异常画面,统计更新还可能把错误状态当成新常态。
产品部署应记录适应前后置信度、能耗和错误率,并设置可回退的干净统计。对电池设备,还要把每秒图像数量乘进能耗预算:单次8.3毫焦很小,高帧率持续运行时仍可能成为可观负担。
参考资料
https://arxiv.org/abs/2609.01683