腾讯、帝国理工学院、密歇根大学等机构的研究人员提出LoCA。它先用一次反向传播完成校准,后续适配只运行前向计算和局部闭式求解。包含校准在内,全程GPU峰值内存比LoRA低26%至29%。
论文图1:LoCA在一次探针反传后,后续循环改用前向激活与局部岭回归。
一次全局误差被拆到每个Transformer块
LoRA虽然只训练少量参数,每一步仍要让误差穿过完整冻结骨干,保存或重算中间激活。LoCA在校准阶段用一批样本做探针反传,为每个Transformer块拟合“最终预测误差到局部隐藏状态修正”的低秩映射。
后续样本只需前向运行。系统用这些映射产生每一层的局部回归目标,再通过岭回归求出低秩适配器,不再重复执行骨干网络的反向链路。
论文第5页:LoCA、LoRA和零阶优化基线在不同Qwen2.5规模上的主结果。
25项比较赢16项,目标不是所有任务全面替代LoRA
研究覆盖Qwen2.5的0.5B、1.5B、3B、7B和14B模型,在五个判别基准上形成25组任务—规模比较。LoCA有16组评估交叉熵低于对应LoRA运行。
作者把方法限定为“小分布偏移适配”。实验没有覆盖长文本生成、复杂指令微调或大幅知识迁移。闭式局部目标能否在这些任务上保持质量,论文没有给出证据。
省下的资源分成校准期和稳定期
全程GPU峰值统计包含一次校准,LoCA约为LoRA的0.71至0.74倍。校准结束后,CPU稳态内存低36%至52%,单次处理时间低43%至48%。这些数字描述调优过程,不是模型上线后的推理加速。
论文第6页:资源表区分包含校准的GPU峰值与校准后的CPU内存、单次耗时。
论文还测试了无需反传的MeZO。全参数MeZO在该设置中随模型规模增大而变差,团队因此采用匹配的Adapter-MeZO作为主基线。这个选择让对比更接近参数高效调优,但也说明结论依赖具体零阶优化配置。
论文图2:全参数MeZO在BoolQ上的结果随规模变化,构成选择适配器基线的依据。
LoCA的实用价值落在反向传播昂贵或不可用的设备。它仍需一次能执行反传的校准,也要在CPU上完成局部求解,不能写成完全“无训练”或适用于所有边缘硬件。