R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
R-KV:面向推理模型的冗余感知KV缓存压缩
机构 * University of Wisconsin - Madison(威斯康星大学麦迪逊分校) ; Microsoft(微软) ; Carnegie Mellon University(卡内基梅隆大学) ; California Institute of Technology(加州理工学院) ; University of California - San Diego(加州大学圣地亚哥分校) ; University of Surrey(萨里大学) ; University of California - Berkeley(加州大学伯克利分校)
AI总结 R-KV通过冗余感知机制实现推理模型KV缓存压缩,以10%的缓存占用率达到接近100%的性能,显著优于现有方法。