论文导读
腾讯、清华大学、中国科学院大学提出Video-HolmesV2,专门检查长视频AI能否把画面与声音放进同一条证据链。模型不只要选对答案,还要给出准确的视听时间位置,靠剧情常识猜中也会暴露。在这套新测试中,强专有模型准确率仍低于60%;团队还用声音锚点压缩无关画面,缓解长上下文噪声。
看见蓝色角色,不代表理解了剧情
很多视频问答可以只看几个关键帧,声音几乎不影响答案。模型于是学会靠画面线索、字幕片段甚至已有剧情知识猜测,评测分数很高,却没有真正完成跨模态推理。
Video-HolmesV2刻意设计必须联合视听证据的问题。画面可能只展示一个异常角色,声音中的历史说明才解释它为何改变社会关系;单独看任一模态都不足以得到完整结论。
论文Figure 1:视觉片段与音频时间段共同组成证据,缺少任一侧都无法完成题目推理。
答案对了,还要交出证据时间戳
基准要求模型输出答案,并标明支持答案的画面与声音出现在哪个时间段。评测分别检查结论和证据,减少随机猜中或引用不存在片段的情况。
数据构建也设置了“单模态陷阱”筛查:如果问题只靠音频或只靠画面就能解决,样本会被剔除;多模型交叉验证后,再由人工审查难例与错误选项。任务覆盖事件内关系、跨事件关联、反事实和全局主题理解。
论文Figure 3:长视频问题经历分层生成、单模态可解性筛查、交叉验证与专家复核。
多抽帧会把证据一起淹没
长视频最直接的处理方式是增加采样帧,但帧数上升会迅速消耗令牌,真正关键的几秒也可能被大量背景画面稀释。团队提出音频—文本引导压缩:先结合问题意图和声音显著位置给视觉令牌打分,关键区域保留细节,背景区域更激进地合并。
论文Figure 4:问题文本与音频锚点共同评估视觉令牌重要性,核心证据保留,背景上下文压缩。
在完整评测中,即使强专有模型准确率也低于60%。论文方法超过可比的开源全模态模型,但这个数字来自Video-HolmesV2,不能外推为模型在所有长视频任务上的通用准确率。案例还显示,模型会给出正确选项却引用错误剧情,证据评估正是为这种情况设计。
下一步,长视频助手要从回答升级到可核查
会议录像、课程、访谈和影视分析都需要模型指出“在哪里看到、在哪里听到”。下一步应把证据时间戳直接接入播放器,用户点击即可复核;模型若找不到两种模态的支持,应允许返回证据不足。Video-HolmesV2提供了答案与证据分开计分的基础,产品可靠性将取决于定位是否稳定,而不只是最终选项是否碰巧正确。
在产品落地前,还需要测试不同语言、噪声音轨和超长内容中的证据召回。