arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

微软与DeepMind团队只加一个Token,视觉检索提高13.4分

arXiv 2607.28627 cs.AI · cs.CV · cs.LG

伊利诺伊大学厄巴纳-香槟分校、微软研究院和Google DeepMind研究人员提出ReToken,通过一个可学习的检索Token,从大量图片或长视频帧中筛选与问题相关的视觉信息。

在Visual Haystacks测试中,ReToken让Qwen3VL-8B提高13.4分,让InternVL3.5-8B提高12.4分,相对增幅均超过20%。它只使用多图片问答数据训练,却能零样本迁移到平均时长超过一小时的视频,在LVBench上为Qwen3VL-8B提高8分。

模型的注意力分数不等于检索分数

多模态模型处理一组图片或长视频时,实际与问题有关的画面通常只占很小一部分。全部视觉Token一起送入模型会占用大量显存,干扰画面增加后,回答准确率也会下降。

现有方法经常根据注意力分数挑选画面。研究团队发现,这种做法在视觉检索中并不稳定。注意力原本服务于下一个Token预测,训练数据里的图片通常都与问题有关,模型很少被要求从大量无关画面中做筛选。

传统注意力分数难以区分相关视频帧

论文图1a:面对大量候选视频帧,常规注意力分数没有把相关帧和干扰帧清晰分开。

团队比较了注意力中的Key和Value表示。在一个受控双图片测试中,用精确目标短语匹配视觉Value均值,Qwen3VL的Recall@1从65.7提高到78.0,InternVL3.5从78.8提高到83.8。Value包含实际向后传递的内容,在这些实验里比常规的Query-Key注意力更适合定位画面。

ReToken在模型不同层的视觉召回率

论文图1b:在QAEgo4D测试中,ReToken在模型后层的Recall@1明显高于注意力检索。

一个Token负责提问,一张投影矩阵负责打分

ReToken在用户问题后加入一个可学习向量。它经过模型最后一层后,与每一帧视觉Value的平均表示计算余弦相似度,得到相关性分数,再保留排名靠前的视觉Token供模型回答。

新增参数除了这个Token,还有一张投影矩阵。默认训练时冻结整个视觉语言模型,只更新这两部分,并根据每张图片是否与答案相关进行二元分类训练。Qwen3VL-8B版本在单张H100上训练三个周期,约4小时完成。

ReToken训练流程

论文图3:ReToken与单个投影矩阵接受相关性监督,默认保持视觉语言模型参数冻结。

这个Token不包含所有视频内容。它是经过训练的检索目标,负责把问题映射到更适合搜索视觉证据的空间。筛选出的图片和视频帧仍然要进入后续推理。

干扰图越多,提升幅度越明显

Visual Haystacks会逐步增加无关图片,观察模型能否在视觉内容中找到答案。Qwen3VL-8B在较短输入上的基础成绩为87.8,干扰增加后降至55.7。加入ReToken后,对应长输入成绩升至67.7;在另一档测试中由58.6提高到72.0,提升13.4分。

检索图片数量变化时的准确率表现

论文图5:在冻结的Qwen3VL-8B上,保留不同数量的检索图片会改变准确率与计算成本。

ReToken还被直接用于长视频,没有使用视频数据继续训练。LVBench上的8分提升说明多图片学习到的检索信号可以迁移到视频帧,但当前方法逐帧独立打分,没有显式建模连续动作和时间关系。

两次前向计算换来更小的后段工作集

ReToken需要先处理较多视觉内容并完成一次检索,再用筛出的Token生成答案,因此是两阶段流程。论文承认,它会增加部分显存占用和响应时间。训练和长视频推理能够放在单张H100上,不代表普通消费级显卡也能运行同等设置。

ReToken长视频缓存、检索与回答流程

论文图4:视频特征先写入视觉KV缓存,问题到来后由ReToken选出top-K帧,再交给模型回答。

逐帧平均还会稀释只占少数Token的细小证据。对“进入房间之前发生了什么”这类带时间偏移的问题,仅靠内容匹配容易找到“进入房间”的画面,却不一定找到此前片段。连续多帧共同表达的事件也可能被独立打分拆散。

13.4分来自特定模型和Visual Haystacks设置,8分来自LVBench零样本迁移,不能概括为所有多模态任务统一提升。ReToken已经公开代码,接下来更值得观察的是加入视频训练、连续片段检索和Token级检索后,速度收益能否覆盖两次前向计算的额外成本。

参考资料

https://arxiv.org/abs/2607.28627

https://github.com/avaxiao/ReToken