Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression
消息而非令牌:用于忠实VLM压缩的基础核心集
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Wuhan AI Research(武汉人工智能研究院) ; Cardiff University(卡迪夫大学)
专题命中 VLM训练与架构 :VLM(title,title_cn);vision language model(abstract);分类 cs.CV
AI总结 该研究针对VLM视觉令牌压缩的现有缺陷,提出无需训练的GMC方法,通过联合分配多维度证据支持并传输被丢弃状态,在大幅减少视觉令牌的同时保持VLM性能,经多基准实验验证有效。
Comments 32 pages, 6 figures, 18 tables, including appendix