把上百张图片或一小时长的视频塞给视觉语言模型,答案明明就在某一帧里,模型却常常答不对。上下文越长,干扰画面越多,成绩掉得越厉害;而把整段视觉序列全量处理,显存又先撑不住,全量微调的成本更是高昂。伊利诺伊大学厄巴纳-香槟分校(UIUC)联合微软研究院、谷歌DeepMind提出 ReToken:冻结整个视觉语言模型,只在视觉序列前加一个可学习的检索 token,让它学会从整段视觉上下文中把与问题相关的证据"捞"出来,单张 H100 即可完成训练与长视频推理。
这个 token 只有一个向量,外加一个投影矩阵是全部新增参数。在 Visual Haystacks 视觉大海捞针测试中,它把 Qwen3VL-8B 在 50 张干扰图下的准确率从 58.6 抬到 72.0,在 QAego4D、LVBench 等长视频基准上也有稳定增益,而且这个 token 只用多图问答数据训练,却能零样本迁移到一小时以上的长视频。
注意力找不到关键帧,问题出在哪
Visual Haystacks 的设定很直接:给模型一批图片,其中只有一张与问题相关,比如问"有奶牛的那张图里有没有卡车"。团队发现,Qwen3VL-8B 从无干扰到 50 张干扰图,准确率一路下滑,而问题 token 对帧 token 的注意力分数几乎与相关性无关——在 QAego4D 上,靠注意力分数做检索,各层平均召回率只有 5.1%。
受控的两图实验还显示,用目标短语匹配视觉特征的 value 投影而非常规的 key,召回率从 65.7 升到 78.0。value 承载的是注意力实际传递的内容,天然更适合做文本对视觉的检索。
图1:两图受控检索示例。面对"有奶牛的图里有没有卡车"的问题,四种匹配方式在 35 层网络中各自挑中真图(绿)或干扰图(红):用目标短语匹配 value 投影几乎全程选中那张黑白街景,靠问题注意力打分则在前十几层频繁选错。
一个 token,学会"检索"而不是"回答"
ReToken 的做法是把一个可学习 embedding 追加到问题后面。训练时,视觉序列先预填充进 KV 缓存,这个 token 在最后一层用自己的投影与每帧的平均 value 向量算余弦相似度,给每帧打一个相关性分数,再用类别均衡的二分类损失监督。骨干全程冻结,被训练的只有这个 token 和一个投影矩阵。
推理时走两遍前向:第一遍让 token 看完全部视觉内容、在最后一层排出帧的相关性,选出最相关的少数帧;第二遍只把选出的帧广播给各层,模型据此生成答案。帧预算不足时直接跳过检索,因此短视频不会触发这套流程。
图2:ReToken 训练方式。视觉语言模型骨干保持冻结,仅训练追加在问题后的检索 token 与一个投影矩阵,监督信号来自帧级相关性标签。
逐层分析显示,原始模型的注意力检索在各层都很弱,而 ReToken 在中后层明显收拢到相关帧上,最后一层的召回率达到原始注意力机制的三倍以上。
图3:逐层注意力召回分析。随着网络加深,检索 token 对相关帧的聚焦越来越强,在最后一层形成清晰的检索信号。
只取一帧,就够答对
在 Visual Haystacks 上,ReToken 的优势随干扰图增多而拉大:50 张干扰图时 Qwen3VL-8B 从 58.6 升到 72.0(+13.4),100 张时从 55.7 升到 67.7(+12.0),相对提升超过两成;换到 InternVL3.5-8B 骨干上同样有效,50 张干扰图时提升 12.4 个点。值得注意的是检索预算 K 设为 1 就拿到了这组成绩——模型只需找回唯一那张相关图,不需要堆帧。开源的 InternVL2 在 50 张干扰图时已经报上下文溢出或显存错误,ReToken 方案则能在单张 H100 上跑完全程。
图4:准确率随检索图片数 K 的变化。K=1 时即达到 72.0% 与 67.7% 的峰值,继续增大 K 反而把干扰图带进上下文,说明瓶颈在"找得准"而非"看得多"。
长视频上同样成立。QAego4D 中 K=1 时,均匀采样与对照方法分别为 42.8、42.6,ReToken 达到 49.6;K=32 时从 55.2、59.8 升到 60.6。平均时长超过一小时的 LVBench 上,成绩从 40.6 升到 48.6(+8.0),Video-MME 长视频分段也有 65.1 到 67.1 的提升。错误分析显示,增益集中在关键信息检索和实体识别这类证据局部、可命名的问题上;证据分散全片的摘要类任务反而会轻微掉分。
图5:Visual Haystacks 量化结果。上下文越长,ReToken 与冻结骨干之间的差距越大,50 张干扰图时相对提升超过 20%。
从"找证据"走向通用增强,还要跨几步
需要看到边界:ReToken 目前只在两个 8B 级骨干和视觉检索类基准上验证,向更大模型和通用对话任务的泛化还缺乏证据。增益随视频变长而变大,但帧数低于 100 时机制不触发,短视频分段没有提升;跨帧时序类事件理解的增益也明显收窄,引入视频数据能否补上时序能力是作者列出的下一步。
ReToken 给"证据藏在大海里"的长上下文场景提供了极便宜的解法:不动模型本体,只训一个 token,就把检索召回和答题准确率一起抬上去。但它更像专精"找东西"的工具,而不是让模型全面变聪明的通用升级。