发表机构
Data Science Institute, Columbia University; Columbia University; Stanford University; CentraleSupélec(哥伦比亚大学数据科学研究所; 哥伦比亚大学; 斯坦福大学; 中央高等电力学院)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
该研究发现Muon训练的Transformer在模块化加法等任务中,顿悟后会因表示-读出接口故障丧失泛化性,冻结嵌入/读出可避免,傅里叶滤波能分离故障与掩码,任务对齐族可恢复性能。
AI 中文摘要
在标准划分下,Muon获取隐藏矩阵,AdamW获取嵌入/输出头。Muon对模113的模块化加法的顿悟速度更快,但其解决方案不具泛化性。在$(a+b) \bmod 113$的9种配置均发生顿悟后丧失泛化能力,5个随机种子中,选定的AdamW参考值有4个低于阈值,达27.59%。这种不稳定性在两种模数、两种宽度、两种训练比例、减法任务及不同深度下均存在。失败源于表示-读出接口,该接口仅能通过损失未选定的可逆映射联合识别。训练集解决后,梯度降至$10^{-6}$量级,优化器响应不同:Muon的步长弹性为-0.03,AdamW为+1.5,Muon组每个参数的移动速度快8倍。在比特相同状态下,冻结任意一组均可防止失败。冻结嵌入/读出可在5次运行(451400步后)及5个配对种子中消除失败:未冻结分支记录137-321次亚阈值评估,冻结分支无。移除Muon的归一化和正交化无法替代:其表示从326个有效共轭对崩溃至4个,无循环崩溃,最终完全失败。傅里叶滤波可分离电路故障与掩码。5个种子3种 regime 的43个检查点中,任务对齐族仅达到100%;电路故障时不再解决任务;掩码时保持完美,而完整模型达45.85%,每个样本(含错误)均有正边际,但被近乎相等的对抗性余数否决。重新缩放可恢复99.9%;顿悟是向上解决的相同条件。任务选择该族,减法下将$(k,k)$替换为$(k,-k)$。在突发崩溃中,标准傅里叶支持不变,功率分布余弦仍为0.9899。
英文摘要
Muon-trained modular-arithmetic transformers can lose accuracy while retaining linearly decodable task information. Adjacent swaps localize five captured unnormalized failures to AdamW readout updates. Multiplying the actual readout displacement by the large feature mean produces a class-dependent logit offset shared across inputs that nearly reproduces each failure. Training-only decoders recover 98.20-100% held-out accuracy. Correcting cross-entropy derivative errors stabilizes five matched branches through step 100,000; four prospective accurate-CE RMS runs fail through embedding updates.
Comments38 pages, 11 figures. Revised manuscript with expanded experiments and analysis. Preprint. Under review