When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware
更少的视觉令牌何时能加速多模态推理?跨决策位置与硬件的盈亏平衡点研究
专题命中 多模态评测 :multimodal(title);分类 cs.CV
AI总结 该研究通过可复现协议分析视觉令牌数量与多模态推理延迟的盈亏平衡点,发现视觉前路由在A100上的延迟优势超过视觉后策略的下游令牌减少量,且视觉后预测器的效果经校正后仍显著。
Comments 16 pages, 3 figures, 13 tables. Experiments use Qwen2.5-VL-3B-Instruct on RTX 3090 and A100 PCIe GPUs