论文导读
加州大学伯克利分校、华盛顿大学、麻省理工学院、英伟达等机构提出LeapQuant,专门压缩线性注意力反复读写的状态。它无需重新训练,在接近FP32精度时把相关内核平均加速2.05至3.70倍,并在多款GPU上获得1.47倍端到端加速。
长文本瓶颈转移到状态读写
线性注意力不再保存所有历史键值,而是把上下文压进固定大小的循环状态。上下文越长,这种设计越省显存;但每处理一个新词都要读取、更新并写回状态,内存带宽和计算仍会成为瓶颈。直接把状态量化到8比特虽然更快,却会让舍入误差逐步累积,少数极大值还会拉坏整块量化范围。
图:矩阵示意对比逐词量化与只在窗口末尾量化的状态更新。
LeapQuant的目标很具体:减少状态搬运,又不让长序列质量明显下降。它不改模型权重,也不要求重新训练,因此可以作为推理阶段的系统优化接入已有线性注意力模型。
按窗口量化,异常值单独保存
第一步不是每个词都量化一次,而是跨过一个窗口,只在窗口末尾量化状态。窗口内部的新增更新暂存在高精度缓冲区,输出由低比特旧状态和高精度新更新共同计算,避免同一误差被连续写回。
图:补偿路径单独保留异常值,再对剩余状态执行低比特量化。
第二步把状态中最大的异常行列抽成少量高精度“补偿Token”,让它们沿真实Token的更新路径参与计算;剩余部分再平滑并量化。这样既保留最难压缩的信息,也让主体矩阵更适合8比特表示。
内核3.70倍,整机1.47倍
团队在Qwen、Kimi和GLM系列模型上测试,并覆盖英伟达B200、RTX PRO 6000与RTX 5090。保持接近FP32精度时,相关内核平均加速落在2.05至3.70倍,端到端推理加速为1.47倍。
图:柱状图给出不同硬件和内核设置下的吞吐量变化。
标题中的3.7倍是论文报告的内核层面区间高点,不是整个应用都快3.7倍。端到端还包含词嵌入、其他注意力层、前馈网络和调度开销,因此最终收益更低;这一差异也是评估系统优化时必须保留的边界。
未来量化将成为长上下文基础设施
下一步可测试更长窗口、不同批量、消费级显卡和服务端并发,特别要观察状态异常值随领域和语言变化是否稳定。若补偿Token数量需要频繁调节,工程部署还应提供自动校准和回退到高精度的机制。
随着混合注意力模型进入代码助手和长文档服务,循环状态可能成为新的推理热区。LeapQuant展示了一种硬件友好的拆法:低比特保存主体,高精度只照顾少量难点,把精度预算用在最会出错的位置。实际服务还应同时记录首Token延迟、持续吞吐和峰值显存,避免单一内核数字掩盖调度瓶颈。