arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Together AI让229B大模型推理快17.5%

作者:arXivDaily编辑部 arXiv 2609.09338 cs · cs.CL

论文导读

Together AI、悉尼大学、伊利诺伊大学厄巴纳-香槟分校等机构提出Osprey,把预训练小模型改造成可跨目标复用的推测解码草稿器。它在229B参数的MiniMax-M2.5上把吞吐提高17.5%,平均接受长度提高22.7%;提升来自论文给定的服务配置和EAGLE-3对照,不是所有硬件上的固定速度。

大模型先审草稿,快不快取决于一次能收多少词

推测解码会让一个便宜的小模型先写出几枚候选token,再让目标大模型一次并行检查。通过检查的候选可以直接提交,遇到不合格位置再回到正常生成。这个过程不改变目标模型的输出分布,却能减少昂贵大模型逐token运行的次数。

问题在于,现有草稿器通常围绕一个目标模型和一类数据训练。聊天数据上表现好的草稿器,换到代码或数学请求时,连续被接受的token会明显减少;换成另一种词表和隐藏层结构的目标模型,往往还要重新训练。大模型本身越来越通用,负责加速它的小模型却很专一。

先把小模型削薄,再保住预训练学到的通用能力

Osprey从现成的小语言模型出发,只保留词嵌入、输出头和前几层Transformer,得到延迟可控的浅层主干。激进裁层会破坏预测能力,因此团队再用通用文本做下一token预训练,把语言能力补回来。这一阶段不接触任何具体目标模型,生成的主干可以重复使用。

图1:Osprey先完成目标无关的裁剪与预训练,再为每个目标做词表对齐和蒸馏。

接入新目标时,系统替换词表,并用原小模型的token组合初始化新增词项。目标模型低、中、高层的隐藏状态会经过投影送入草稿器;新增加的注意力列从零开始,避免一接入目标特征就破坏原有预测。最后再用目标模型输出做蒸馏,完成每个部署对象的轻量适配。

跨领域接受长度增加,MiniMax吞吐提高17.5%

在Qwen3-8B实验中,草稿器分别用聊天、代码、常识、金融和数学数据适配,再跨五个领域测试。Osprey的平均接受长度比从头训练的EAGLE-3高16.1%,域外与多语种数据的增益更明显。图中的矩阵也显示,训练领域和测试领域不一致时,预训练主干更不容易失速。

图2:Osprey与EAGLE-3在五类训练、测试领域组合上的平均接受长度。

规模扩大后,Llama-3.3-70B-Instruct的平均接受长度提高21.2%,每秒token数提高17.9%;MiniMax-M2.5约229B参数,两个数字分别为22.7%和17.5%。这些比较采用匹配的EAGLE-3基线。吞吐仍受GPU、批大小、请求长度、前瞻步数和服务实现影响,不能把17.5%直接套到另一套系统。

图3:继续预训练过程中,浅层草稿主干的困惑度逐步下降。

从单模型定制走向草稿器底座复用

Osprey把最昂贵的通用预训练放在可复用主干上,每个目标只承担词表、隐藏状态和输出分布适配。对同时托管多种模型的服务商,这比每次从零开始更有吸引力。后续需要比较完整训练成本、不同硬件上的盈亏点,并测试量化模型、长上下文和高并发请求。只有端到端节省超过预训练与适配开销,这套方法才会成为长期服务基础设施。

参考资料

https://arxiv.org/abs/2609.09338

https://arxiv.org/html/2609.09338

https://github.com/LeanModels/Osprey