arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

复旦北大找到低精度训练崩溃通道,QK-Guard守住6万步

arXiv 2608.02091 cs.LG

复旦大学、哈尔滨工业大学和北京大学等团队复现了bfloat16 Transformer训练中的突然崩溃:模型可以正常运行很多步,注意力随后快速失控。研究发现,不同位置的低精度误差最终会汇入查询—键权重的共同通道。

团队据此设计QK-Guard。控制器平时休眠,检测到注意力logit开始饱和后才启动无参数QK归一化,抑制了全部受测失控,并在6万步实验中达到与全程开启归一化相近的稳定性。

不同误差源汇入同一QK失控通道

论文图1:误差被放在QK、MLP或Value等不同位置时,查询权重都出现相似谱失控。

故障出现的位置不等于真正的失控通道

研究先把一类GPT-2级崩溃定位到流式softmax累加器,改用fp32累加可以修复。随后,团队把可控误差移动到注意力外部,模型仍出现同样的QK谱爆炸;只修正QK后,即使原误差继续存在,训练也保持稳定。

这种源与通道的分离改变了修复思路。若每种低精度误差都需要一套补丁,训练系统会越来越复杂;如果多个误差共享QK通道,就可以优先在汇合点拦截。

因果探针把三条奇异方向拿掉

为确认QK不是伴随指标,研究人员把每一步更新从当前QK权重的前三条主奇异方向中投影出去,再保持更新总能量不变。处理查询投影后,最大奇异值维持在11.1;从其他位置移除等量能量,数值仍升到237。

移除不同方向后QK谱的变化

论文图2:只有针对QK主方向的投影能压住早期失控,等能量对照没有效果。

进入失控还取决于多步更新方向是否持续同号,而非单步误差总量。许多微小偏差若连续沿同一方向累积,会把QK权重推入快速增长区。

QK-Guard等到饱和信号出现才介入

控制器周期性读取注意力logit统计量,超过固定阈值后永久开启QK归一化。它不增加可学习参数,也不在训练开始时改变所有注意力计算。

QK-Guard触发前后的训练曲线

论文图3:监测信号越过阈值后,QK归一化启动并阻止谱值继续失控。

在相同触发时刻改动非QK部分无法阻止崩溃。论文还换用第二种GPU架构复查,B200实验得到一致方向,说明现象不是单张卡或单一执行路径的偶然结果。

QK-Guard在B200上的复现实验

论文补充图S1:不同执行方式下,对照组发生崩溃,QK处理组保持稳定。

结论范围仍是受控训练实验

实验覆盖有限架构、规模、GPU和人工构造误差,不能把所有大模型训练崩溃都归因于QK通道。更大模型还会遇到优化器、数据、通信和硬件故障等其他问题。

QK-Guard目前提供的是一条可复现的诊断与防护路径。要进入大规模训练基础设施,还需检查它对不同注意力变体、长周期训练和最终模型质量的影响。

参考资料

https://arxiv.org/abs/2608.02091

https://github.com/xieTwim/one-qk-channel-artifact