DT-Project研究者的一项0.6B语言模型改造实验出现了反常结果:学生模型的困惑度已经接近教师,C-Eval选择题准确率却只有25%至29%,并在81%的回答中预测“A”。问题不在于知识全部丢失,而是模型没有跟随答案内容切换选项标签。
论文第2页:研究将Qwen3-0.6B的28个全注意力层中的21个转换为KDA线性注意力。
四次轮换选项,内容不变只换标签
研究者在单张消费级GPU预算下,把Qwen3-0.6B-Base的21层改成Kimi Delta Attention。隐藏状态对齐和端到端KL蒸馏让常规分布指标恢复,但选择题接口仍然失效。
诊断方法很直接:同一道题连续测试四次,每次轮换A、B、C、D对应的答案内容。161道题里有106道在四种排列下始终输出同一个标签;模型预测A的比例为81.06%,四排列准确率36.18%。教师模型在相同诊断中的准确率为66.46%。
论文第4页表1和表2:改造后模型固守A,定向修复使C-Eval由28.83%升至41.31%。
1000步只修答案格式,分数回升12.48
团队准备6250道在四种轮换下都能被教师答对的选择题,再加入诗歌和翻译问答,进行1000步“仅完成部分”的KL训练。提示文本不计损失,优化目标集中在答案输出边界。
修复后C-Eval由28.83%升到41.31%,提高12.48个百分点;预测A的比例降到58.5%,四次保持同一标签的问题从106道降到47道。论文明确称它是“大幅修复但没有治愈”,因为均衡状态下A占比应接近25%。
另一个静默故障会让更新直接消失
工程记录显示,早期实验用bf16参数和bf16 Adam状态时,小更新会被数值精度吞掉:一个初始化为1.0的门控权重训练1000步后仍精确等于1.0。后续阶段改用FP32主权重和优化器状态。
模型完成格式修复后又接受角色SFT和一轮在线DPO,最终C-Eval保持在噪声范围内。完整训练谱系表同时记录了各阶段的困惑度、准确率和接口指标。
论文第5页表3:不同训练阶段的C-Eval、困惑度和工程配置被放在同一条审计线上。
这是一项单模型、单次结构转换的工程案例。它不能证明所有线性注意力改造都会“只答A”,也不能用困惑度接近教师来证明知识完全保留。更可靠的结论是:结构手术后,输出接口需要单独做标签轮换和格式一致性测试。
参考资料
https://arxiv.org/abs/2608.02689