arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

阿里、中科大等让AI挑着细看,省43%视觉Token保留98.9%表现

作者:arXivDaily编辑部 arXiv 2610.07987 cs · cs.AI · cs.CL · cs.CV

论文导读

阿里巴巴、中科大、香港中文大学、浙江大学提出VisionWeave,让看图模型根据内容决定哪里细看、哪里用粗块表示。在Qwen3.8-27B的八项基准上,它平均减少43%的视觉Token,保留约98.9%的原生表现。接入SGLang后,论文测得端到端吞吐达到原来的2.30倍,节省计算也落实到了服务速度。

文档小字与大片背景,不该花一样多算力

看图模型通常把画面切成很多小块,每块变成一个视觉Token,再送入语言模型。页面里密密麻麻的小字需要保留细节,空白或背景却未必值得同样多的计算。统一把图片缩小,容易先损伤文字和图表。

直接删掉一部分小块也会出问题。某个看起来不起眼的区域,可能正好包含用户要找的按钮或答案。VisionWeave保留画面覆盖范围,用不同大小的表示分配计算,重要区域维持细粒度,其他区域合成较粗的块。

论文的示例覆盖自然图片、道路画面、文档和图表。同一种压缩比例很难兼顾它们,研究希望模型自行判断每张输入需要多少细节。

图:自然物体、文字、道路与图表画面及其不同粒度视觉网格对照。

让模型学习哪里合并、哪里保留

方法先为同一画面准备细粒度和粗粒度表示,再由一个分配器决定各区域采用哪一种。送到语言模型的是混合粒度序列,细节密集的区域能继续保留更多小块。

训练时,原生模型提供参照答案与内部表示,压缩后的模型学习接近这些输出。研究在Qwen3.5-4B上验证方法,再扩展到Qwen3.8-27B。论文将这种根据内容调节表示粒度的能力直接纳入模型训练,避免只在推理时突然删掉它没学过怎样处理的信息。

图中的网格可以看出哪些区域被合并,但网格疏密本身不是答案正确率。是否保住理解能力,还需要看文档问答、界面定位、视频理解等独立测试。

图:细粒度与粗粒度视觉信息经分配器组合后送入语言模型。

平均省43%,并非所有图片都砍一半

Qwen3.8-27B在八项基准上,原生平均得分为77.65,VisionWeave为76.73,相对损失约1.08%,视觉Token平均减少43.0%。这对应标题中的约98.9%表现保留,不能解释成所有任务的准确率都达到98.9%。

文档和信息图保留了更多细节:DocVQA节省27.3%,InfoVQA节省16.5%;三项视频测试的节省幅度约49.6%至54.2%。压缩多少随内容变化,并未固定为每张图删除一半。

固定以50%为节省目标的两种对比方法,在27B模型上平均表现损失约11.82%和12.46%。服务实验里,VisionWeave达到2.30倍吞吐,平均首Token等待时间减少54.4%,后续Token平均耗时减少60.6%;这些是论文指定服务设置中的数字。

界面定位案例还展示了原始画面、直接删块与混合粒度表示的对照,保留画面覆盖与删掉部分区域会得到不同的信息输入。

图:桌面、平板和网页原图,以及删块与混合粒度表示的区域覆盖对照。

从少Token走到实际部署收益

减少视觉序列长度会改变后续模型需要处理的信息量。论文把方法接进SGLang,进一步检查了服务端吞吐与等待时间,而不只报告Token数量。

应用时仍需要按输入类型评估:文档小字、复杂图表和视频帧的压缩需求不同,固定比例很容易抹掉任务相关区域。沿着这条路线,部署团队可以在相同图像预算下比较内容自适应分配与简单缩图,直接观察答案质量和实际请求耗时。

参考资料

https://arxiv.org/abs/2610.07987

↑