扩散语言模型可以并行修改多个词元,但长序列中的全注意力仍会吃掉大量计算。Apple、Google DeepMind与哈佛大学研究者在MIT开展的工作提出LLaDA-Hybrid:把16B模型20层中的6层换成块级混合注意力,再通过两阶段轻量适配恢复能力。在单张H200、128路并发下,解码吞吐从2310.2升至3994.4 token/s,提升1.73倍。
全注意力是并行生成的隐形账单
自回归模型一次追加一个词元,扩散语言模型则反复去噪一整块被遮盖的词元。后者带来并行生成的空间,也意味着每一轮都可能重新计算长范围注意力。上下文变长或并发请求增加时,二次复杂度会逐渐吞掉硬件吞吐优势。
线性注意力可以维护固定大小的循环状态,成本随长度增长更温和,但完全替换会损伤模型原有能力。团队选择折中方案:在当前活动块内部保留Softmax注意力,以精确处理正在生成的词元;对之前已经完成的块使用线性注意力状态,避免反复读取全部历史。
蓝色块保留精细的块内交互,橙色历史由固定状态压缩,兼顾局部质量与长程效率。
只替换6层,再分两步“补课”
实验以LLaDA 2.1-mini这一16B扩散语言模型为教师,共20层中只线性化6层。第一阶段进行逐层注意力迁移,让混合层拟合原Softmax层的输出;该阶段使用约1700万词元,在两张L40S上训练24小时。
第二阶段做端到端低秩适配,只更新LoRA参数,让多层组合后的误差重新协调。它使用约500万词元,在同样两张L40S上再训练约6小时。相比从头训练16B模型,这种“先逐层模仿、再整体校正”的转换成本小得多,也保留了大部分原始权重。
速度提高,能力并非毫无代价
在无编辑解码设置下,LLaDA-Hybrid的HumanEval为72.0,教师模型为75.6;CMATH为86.7对88.3。它也有反向提升:MBPP+从57.7升至63.0,普通MBPP为70.6对70.4。但GPQA-Diamond从38.9降至30.8,下降8.1个百分点,是不能忽略的推理能力损失。
多数任务接近教师模型,GPQA-Diamond的明显下降说明效率转换仍存在能力取舍。
吞吐测试采用单张H200、2048生成长度和1024词元提示池。并发16时速度由1845.7升至2761.7 token/s,为1.50倍;并发64时达到1.64倍;并发128时达到1.73倍;并发256时仍有1.60倍。提升在服务器批处理场景更明显,而不是宣称每个单用户请求都快同样倍数。
加速随并发先升后降也符合混合注意力的设计:请求较少时,固定开销会稀释线性历史的收益;批量增大后,减少历史注意力计算更值钱;到了256路并发,其他内存与调度瓶颈开始显现。因此标题中的1.7倍是128并发峰值配置,不是跨硬件、跨负载恒定的速度倍率。论文公开完整表格,正好能避免只挑一个峰值误读。
1.7倍对应特定H200并发配置,硬件、批处理和生成长度都会影响实际收益。
下一步走向更多模型与更长上下文
这项工作说明,大型扩散语言模型不必在全注意力和完全线性化之间二选一。只替换部分层,并给局部与历史分配不同注意力机制,可以在较低训练成本下获得显著服务吞吐。
下一步可以把两阶段转换应用到更多尺寸和架构的扩散语言模型,并系统增加线性化层数、上下文长度与生成块大小。服务端还可以根据并发量动态选择混合层配置,在低延迟和高吞吐负载之间切换。
当前实验覆盖特定16B模型、6层替换和中等序列,GPQA-Diamond下降8.1个百分点。后续转换需要把科学推理等敏感任务加入质量回归,并与吞吐压测同步进行;教师激活和适配数据也应形成可重复的准备流程。
如果不同模型都能用少量数据完成这种改造,混合注意力将成为已有扩散语言模型的部署升级路径,而不必等待下一轮完整预训练。