arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

模型困惑度正常,却有81%的选择题只答A

arXiv 2608.02689 cs.CL · cs.LG

DT-Project研究者的一项0.6B语言模型改造实验出现了反常结果:学生模型的困惑度已经接近教师,C-Eval选择题准确率却只有25%至29%,并在81%的回答中预测“A”。问题不在于知识全部丢失,而是模型没有跟随答案内容切换选项标签。

Qwen3注意力层转换与训练设置

论文第2页:研究将Qwen3-0.6B的28个全注意力层中的21个转换为KDA线性注意力。

四次轮换选项,内容不变只换标签

研究者在单张消费级GPU预算下,把Qwen3-0.6B-Base的21层改成Kimi Delta Attention。隐藏状态对齐和端到端KL蒸馏让常规分布指标恢复,但选择题接口仍然失效。

诊断方法很直接:同一道题连续测试四次,每次轮换A、B、C、D对应的答案内容。161道题里有106道在四种排列下始终输出同一个标签;模型预测A的比例为81.06%,四排列准确率36.18%。教师模型在相同诊断中的准确率为66.46%。

四排列诊断与定向修复结果

论文第4页表1和表2:改造后模型固守A,定向修复使C-Eval由28.83%升至41.31%。

1000步只修答案格式,分数回升12.48

团队准备6250道在四种轮换下都能被教师答对的选择题,再加入诗歌和翻译问答,进行1000步“仅完成部分”的KL训练。提示文本不计损失,优化目标集中在答案输出边界。

修复后C-Eval由28.83%升到41.31%,提高12.48个百分点;预测A的比例降到58.5%,四次保持同一标签的问题从106道降到47道。论文明确称它是“大幅修复但没有治愈”,因为均衡状态下A占比应接近25%。

另一个静默故障会让更新直接消失

工程记录显示,早期实验用bf16参数和bf16 Adam状态时,小更新会被数值精度吞掉:一个初始化为1.0的门控权重训练1000步后仍精确等于1.0。后续阶段改用FP32主权重和优化器状态。

模型完成格式修复后又接受角色SFT和一轮在线DPO,最终C-Eval保持在噪声范围内。完整训练谱系表同时记录了各阶段的困惑度、准确率和接口指标。

模型改造、修复与后续训练的完整谱系

论文第5页表3:不同训练阶段的C-Eval、困惑度和工程配置被放在同一条审计线上。

这是一项单模型、单次结构转换的工程案例。它不能证明所有线性注意力改造都会“只答A”,也不能用困惑度接近教师来证明知识完全保留。更可靠的结论是:结构手术后,输出接口需要单独做标签轮换和格式一致性测试。

参考资料

https://arxiv.org/abs/2608.02689

https://github.com/Sisyphbaous-DT-Project/open-qingyi

https://huggingface.co/shiershuihesaixiliya/qingyi-kda-0.6b