KV-Efficient VLA: A Method to Speed up Vision Language Models with RNN-Gated Chunked KV Cache
KV-Efficient VLA: 一种加速视觉语言模型的方法通过RNN门控分块KV缓存
机构 * University of Toronto(多伦多大学) ; Tsinghua University(清华大学)
专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV
AI总结 KV-Efficient VLA通过RNN门控分块KV缓存机制,有效降低视觉语言模型的计算和内存开销,提升推理效率。