arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

只加0.017%参数,多模态AI准确率相对涨26.9%

作者:arXivDaily编辑部 arXiv 2609.10346 cs · cs.AI · cs.CV

论文导读

新加坡国立大学、Cardinal AI Lab、香港科技大学等机构提出VIP-Router,让多模态模型为每张图片单独选择视觉token剪枝策略,也可以判断这次不该剪。路由器新增参数仅占主干0.017%,在剪枝敏感的VTC-Bench Group A上平均准确率相对最佳固定策略提高26.9%;该数字不是通用视觉问答绝对涨幅。

同一个剪枝方法,不可能对每张图片都最合适

多模态大模型会把图片切成数百甚至数千个视觉token,再交给语言模型处理。删掉不重要的token可以降低显存和计算,但不同方法判断“重要”的依据不同:有的看注意力,有的看相似度,有的保留局部结构。固定使用一种策略,平均分可能不错,却会在某些样本上恰好删掉回答问题所需的细节。

论文先统计多种剪枝方法的互补性。在40组基准与保留比例组合中,没有一种策略赢过一半设置。对至少有一种剪枝策略能答对的样本,超过三分之一属于“平均最佳策略答错、另一种策略答对”。平均冠军并不等于每道题的最佳选择。

图1:不同保留比例下,固定最佳策略仍会漏掉其他策略能答对的大量样本。

先用低成本预览,再决定剪哪一种或全部保留

VIP-Router不直接运行所有方案再挑答案。它读取冻结的视觉与文本预览特征,再结合问题和token保留比例,预测每种候选剪枝策略的效用。路由器还把“Full”完整token推理放进候选;如果判断剪枝会明显伤害结果,就选择不剪。

图2:低成本图文预览特征进入路由器,输出各剪枝策略与完整推理的效用预测。

底层多模态模型和现有剪枝算法都不用改,训练参数只来自这个轻量路由器,相当于主干的0.017%。路由器学习的不是统一删token规则,而是“这张图、这个问题、这个预算更适合哪种现成方法”。同一图片换一个问题,选择也可以改变。

剪枝敏感基准相对涨26.9%,成本折算效用相对涨22%

在VTC-Bench Group A上,VIP-Router在所有测试压缩比例都超过最佳固定策略,平均准确率相对提高26.9%。把实际token成本计入效用后,平均相对提升为22.0%。方法也在不同多模态主干和未见基准上取得一致增益,说明路由器没有只记住一组固定题目。

图3:VIP-Router与固定剪枝方案在计算量和准确率之间的实验前沿。

Group A专门挑选完整token能答对、简单降采样后会答错的剪枝敏感样本,难度和普通全量测试不同。26.9%是相对最佳固定策略的平均准确率提升,不是所有多模态任务都绝对增加26.9个百分点。路由器本身也可能选错,只是错误选择造成的效用损失在实验中较小。

未来部署要让token预算随样本变化

实际服务可以根据延迟档位设定保留比例,再让路由器逐请求选择策略。简单图片可能大幅剪枝,细粒度定位和文字读取题则保留更多token。后续需要把路由器开销、批处理效率和硬件吞吐一起测量,并扩大到视频与多图输入。若选择信号能跨模型复用,它还可以成为多种压缩算法之上的统一调度层。

参考资料

https://arxiv.org/abs/2609.10346

https://arxiv.org/html/2609.10346