2505.18610
2026-07-14
cs.CL
版本更新
PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs
PM-KVQ:用于长思维链语言模型的渐进式混合精度键值缓存量化
Tengxuan Liu, Shiyao Li, Jiayi Yang, Tianchen Zhao, Feng Zhou, Xiaohui Song, Guohao Dai, Shengen Yan, Huazhong Yang, Yu Wang
机构
*
Tsinghua University(清华大学)
;
Infinigence-AI
;
Columbia University(哥伦比亚大学)
;
OPPO AI Center(OPPO人工智能中心)
;
Shanghai Jiaotong University(上海交通大学)
AI总结
针对长思维链语言模型因键值缓存内存开销大导致性能下降的问题,提出渐进式混合精度KV缓存量化(PM-KVQ),通过渐进量化策略和逐块内存分配减少累积误差,用带位置插值的校准策略增加校准长度,提升了推理性能和吞吐量。