MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression
MosaicKV: 通过动态二维KV缓存压缩服务长上下文LLM
机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(上海交通大学并行与分布式系统研究所)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.LG
AI总结 提出MosaicKV系统,利用动态二维KV缓存压缩解决长上下文服务中的内存瓶颈,通过细粒度稀疏性和压缩管理实现高吞吐和低延迟,在H800 GPU上取得最高16倍注意力加速和3倍内存节省。
Comments 15 pages, 10 figures