论文导读
投机解码能大幅加快大模型推理,但传统方案中草稿模型保留的KV缓存占据了宝贵显存,在高并发服务下极易引发显存枯竭。哈佛大学联合第一资本、红帽公司与英伟达等机构推出了全新投机解码框架H-Spec。该架构将草稿模型的KV缓存彻底归零,同时将平均Token接受长度提升了5%至13.3%,实现了无显存负担的极速并行推理。
核心背景与草稿显存痛点
随着大型语言模型在高并发企业级应用中的全面铺开,推理集群的显存开销与首字延迟成为了制约服务扩容的核心瓶颈。作为业界最成熟的无损推理加速技术,投机解码通过让一个小型草稿模型快速预测多个候选Token,再由目标大模型一次性并行验证,能够实现翻倍的加速效果。然而哈佛大学、第一资本、红帽公司与英伟达的研究团队联合发现,为了维持草稿模型的预测精度,系统通常必须为草稿模型单独维护一份巨大的KV缓存,使得并发处理能力严重受限。
为了彻底消灭草稿缓存带来的显存膨胀,研究人员研发了名为H-Spec的混合投机解码架构。H-Spec将原本基于自注意力的草稿小模型重构为混合Mamba与轻量前馈层的极简状态结构,每一次预测直接利用目标大模型已有的深层隐层特征,自身完全无需持久化存储任何键值缓存。
图:在单张H100显卡上不同并发请求压力下的延迟与吞吐拐点对比
混合状态重构与零缓存机制
通过消除草稿KV缓存的内存分配与显存读写瓶颈,系统将草稿小模型的单步生成开销降至极限。更令人惊喜的是,得益于跨层特征蒸馏与并行采样策略的优化,H-Spec不仅显存开销归零,每个验证轮次被目标大模型采纳的平均Token长度反而提升了5%至13.3%。
图:用于训练高效草稿头的高质量长文本投机解码预处理语料概览
关键突破与极限并发压测
在配备单张英伟达H100张量计算卡的标准企业推理服务器上进行的严苛高并发压力测试中,H-Spec展现出了压倒性的吞吐优势。在同时处理数百个长文本检索增强生成的重负载下,传统投机解码由于显存耗尽早早触发了延迟雪崩,而H-Spec却依然保持着高吞吐平稳输出,整体系统吞吐量提升了近一倍。
图:基于vLLM深度优化的投机解码开源框架整体软件架构与接口定义
未来应用与落地展望
这一技术革新为云端数据中心与私有化大模型部署带来了立竿见影的成本优化价值。未来随着该算法深度合并进vLLM等主流高性能推理引擎,各行各业的企业级大模型在线服务将以更低廉的硬件成本为数以亿计的终端用户提供秒级低延迟交互体验。