VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference
VisCache:用于高效视觉大语言模型推理的视觉键值缓存剪枝方法
机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 VisCache是一种无需训练的即插即用视觉KV缓存剪枝框架,通过两阶段协同操作提升VLLM长上下文推理效率,实现最高2.35倍加速,建立效率与性能的新帕累托前沿。