arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

快手等让Qwen、GLM和MiniMax跨Tokenizer教小模型,六项基准提升3.7至6.6分

作者:arXivDaily编辑部 arXiv 2607.22334 cs · cs.AI · cs.CL · cs.LG

Qwen、GLM和MiniMax可以各自当老师,但它们切分文字的Token规则不同,教师给出的概率分布不能直接交给同一个学生模型。中国科学院大学、快手KwaiKAT团队、浙江大学、香港中文大学提出BPM,把不同Tokenizer的输出搬到共享字节空间,再完成在线蒸馏。

在三组教师—学生配对和六项数学、编程基准上,BPM的avg@8比各组最强基线高3.7至6.6分;最佳组合关闭43.9%的师生性能差距。结果来自指定模型、训练数据与评测,不代表任意大模型都能获得同样幅度。

两个Tokenizer先对齐字节,不对齐词表

传统全词表蒸馏通常假设教师和学生共享Tokenizer。跨模型家族时,一个教师Token可能对应多个学生Token,也可能跨越学生边界。直接按排名或字符串匹配,会丢失概率质量,甚至把概率分给内容不相干的Token。

论文Figure 2:教师和学生以不同方式切分同一串字节,BPM把概率路由到最长匹配的学生前缀。

BPM为每个教师Token寻找字节表示上的最长学生前缀,把映射到同一学生Token的概率相加,无法匹配的部分进入显式残差类别。论文报告,超过99%的训练位置满足精确字节前缀边缘条件。

Tokenizer越不同,直接迁移越容易失真

团队比较Qwen3-32B、GLM-Z1-9B-0414和MiniMax-M2.7三类教师,与Qwen学生模型在词表、边界和跨度上的相似度。模型名字相近不等于切词行为相近,真正影响蒸馏的是同一文本如何被切成Token序列。

论文Figure F.1:三组教师—学生在词表重合、跨度Jaccard和边界一致性上的差异。

预计算的路由表在训练前生成,在线阶段不需要不断重新搜索映射。学生仍按自己的模板和Tokenizer采样,教师则在自己的模板中对相同字节内容重新评分。

六项数学和编程基准全部胜出

项目结果表将BPM与SimCT、ULD、GOLD和序列蒸馏等方法比较。三组教师配对中,BPM的六项平均avg@8分别达到39.0%、41.5%和38.7%,对应提升3.7、6.6和5.9分;pass@8也分别提高8.5、5.5和9.1分。

论文主要结果表:Qwen、GLM和MiniMax教师配对在六项任务上的avg@8与pass@8。

最容易被忽略的失败来自代码空白行。字节级匹配过于忠实,会把教师的缩进分段习惯当作知识传递,某组实验的代码通过率一度从49%降到9%。团队用预计算的空白行掩码移除这类噪声。

avg@8与pass@8回答的问题不同。前者关注多次采样的平均正确水平,后者关注八次尝试中至少一次成功的概率;同一种蒸馏方法可能同时提高两者,也可能主要改善其中一个。标题采用六项平均avg@8的差值,没有把“多采样命中率”混写成单次回答准确率。

BPM解决的是输出概率如何跨Tokenizer对齐,不负责自动判断教师答案是否正确。如果教师在某类题上存在稳定错误,学生仍可能继承偏差。多教师场景还要考虑路由、采样成本和训练吞吐,不能仅凭模型数量推断学生一定更强。

字节空间的优势是语言无关且可逆,但它也会放大格式细节。除代码缩进外,Unicode组合、不可见字符和不同模板都可能影响前缀边缘化。公开实现后,值得优先复核的不只是最终分数,还包括这些异常输入是否被一致处理。

论文消融实验:不同散度选择、数据混合和空白行掩码对数学与代码任务的影响。

下一步是更多模型家族和真实部署成本

跨Tokenizer蒸馏的直接用途,是把多个模型家族的互补能力压进更小的学生模型,而不要求它们先统一词表。对端侧或私有部署团队,这比为每个教师重建训练管线更灵活。

项目页当前把代码标注为1至2个月后提供,因此可复核的核心仍是论文算法、表格和项目页结果。后续需要观察公开实现的训练吞吐、显存开销,以及在更多语言、代码格式和不同学生架构上的稳定性。

参考资料

https://arxiv.org/abs/2607.22334

https://arxiv.org/html/2607.22334

https://bpm-opd.github.io/