DistillCache: KL-Guided Adaptive KV-Cache Eviction for Memory-Efficient LLM Inference
DistillCache:基于KL引导的自适应KV缓存驱逐的内存高效大语言模型推理
机构 * Oklahoma State University(俄克拉荷马州立大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 DistillCache是一种强化学习框架,将KV缓存驱逐建模为序列决策问题,在25%缓存预算下,在LongBench上保留全缓存94.2%的准确率,优于多种基线方法,可提升推理吞吐量。
Comments 20 pages, 5 figures