伊利诺伊大学厄巴纳-香槟分校、微软研究院和Google DeepMind研究人员提出ReToken,通过一个可学习的检索Token,从大量图片或长视频帧中筛选与问题相关的视觉信息。
在Visual Haystacks测试中,ReToken让Qwen3VL-8B提高13.4分,让InternVL3.5-8B提高12.4分,相对增幅均超过20%。它只使用多图片问答数据训练,却能零样本迁移到平均时长超过一小时的视频,在LVBench上为Qwen3VL-8B提高8分。
模型的注意力分数不等于检索分数
多模态模型处理一组图片或长视频时,实际与问题有关的画面通常只占很小一部分。全部视觉Token一起送入模型会占用大量显存,干扰画面增加后,回答准确率也会下降。
现有方法经常根据注意力分数挑选画面。研究团队发现,这种做法在视觉检索中并不稳定。注意力原本服务于下一个Token预测,训练数据里的图片通常都与问题有关,模型很少被要求从大量无关画面中做筛选。
论文图1a:面对大量候选视频帧,常规注意力分数没有把相关帧和干扰帧清晰分开。
团队比较了注意力中的Key和Value表示。在一个受控双图片测试中,用精确目标短语匹配视觉Value均值,Qwen3VL的Recall@1从65.7提高到78.0,InternVL3.5从78.8提高到83.8。Value包含实际向后传递的内容,在这些实验里比常规的Query-Key注意力更适合定位画面。
论文图1b:在QAEgo4D测试中,ReToken在模型后层的Recall@1明显高于注意力检索。
一个Token负责提问,一张投影矩阵负责打分
ReToken在用户问题后加入一个可学习向量。它经过模型最后一层后,与每一帧视觉Value的平均表示计算余弦相似度,得到相关性分数,再保留排名靠前的视觉Token供模型回答。
新增参数除了这个Token,还有一张投影矩阵。默认训练时冻结整个视觉语言模型,只更新这两部分,并根据每张图片是否与答案相关进行二元分类训练。Qwen3VL-8B版本在单张H100上训练三个周期,约4小时完成。
论文图3:ReToken与单个投影矩阵接受相关性监督,默认保持视觉语言模型参数冻结。
这个Token不包含所有视频内容。它是经过训练的检索目标,负责把问题映射到更适合搜索视觉证据的空间。筛选出的图片和视频帧仍然要进入后续推理。
干扰图越多,提升幅度越明显
Visual Haystacks会逐步增加无关图片,观察模型能否在视觉内容中找到答案。Qwen3VL-8B在较短输入上的基础成绩为87.8,干扰增加后降至55.7。加入ReToken后,对应长输入成绩升至67.7;在另一档测试中由58.6提高到72.0,提升13.4分。
论文图5:在冻结的Qwen3VL-8B上,保留不同数量的检索图片会改变准确率与计算成本。
ReToken还被直接用于长视频,没有使用视频数据继续训练。LVBench上的8分提升说明多图片学习到的检索信号可以迁移到视频帧,但当前方法逐帧独立打分,没有显式建模连续动作和时间关系。
两次前向计算换来更小的后段工作集
ReToken需要先处理较多视觉内容并完成一次检索,再用筛出的Token生成答案,因此是两阶段流程。论文承认,它会增加部分显存占用和响应时间。训练和长视频推理能够放在单张H100上,不代表普通消费级显卡也能运行同等设置。
论文图4:视频特征先写入视觉KV缓存,问题到来后由ReToken选出top-K帧,再交给模型回答。
逐帧平均还会稀释只占少数Token的细小证据。对“进入房间之前发生了什么”这类带时间偏移的问题,仅靠内容匹配容易找到“进入房间”的画面,却不一定找到此前片段。连续多帧共同表达的事件也可能被独立打分拆散。
13.4分来自特定模型和Visual Haystacks设置,8分来自LVBench零样本迁移,不能概括为所有多模态任务统一提升。ReToken已经公开代码,接下来更值得观察的是加入视频训练、连续片段检索和Token级检索后,速度收益能否覆盖两次前向计算的额外成本。