Multi-Image Visual Token Pruning in Large Visual Language Models
多图像视觉语言模型中的多图像视觉令牌剪枝
机构 * University of Science and Technology of China(中国科学技术大学) ; Xiaohongshu Inc.(小红书科技有限公司)
AI总结 本文针对现有LVLMs多图像剪枝方法的局限,提出无需训练的AVTP框架,在多类LVLMs上实现显著推理加速,同时保持较高准确率,部分模型性能甚至优于基线。
Comments 14 pages, 3 figures