AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
AdaptInfer: 用于视觉-语言模型推理的自适应令牌剪枝与动态文本引导
机构 * Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心) ; Department of Automation, Tsinghua University(清华大学自动化系) ; School of Computer Science, Peking University(北京大学计算机科学系)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV
AI总结 AdaptInfer通过动态文本引导和自适应令牌剪枝,有效降低视觉-语言模型推理成本,提升推理效率与准确性。