论文导读
百度提出VideoXAgent,让AI面对小时级视频时先按问题检索,再调用字幕、画面和音频工具取证。它用约5万Token智能体上下文,在Video-MME-Long、LVBench和MINERVA分别达到85.1%、76.5%和65.7%;结果来自三项基准,不代表任意长视频都能稳定回答。
长视频难点不是看不见,而是塞不下
处理几分钟视频时,模型可以均匀抽帧,把画面和字幕一次送入上下文。视频延长到一小时,帧数、字幕和声音线索迅速膨胀;盲目塞得更多会带来成本,也会让无关片段淹没真正证据。
VideoXAgent把模型变成检索代理。它先理解问题,估计答案可能出现的时间和模态,再选择查看字幕、视觉片段或音频,而不是从头到尾平均采样。每次查看结果都会更新下一步搜索范围。
项目图:智能体围绕问题调用长视频检索工具,逐步缩小时间区间并汇总多模态证据。
像查档案一样逐步找证据
如果问题问“跑步者什么时候到达”,代理可以先在字幕或粗粒度索引中定位相关时段,再查看到达前后的画面;如果问题与声音事件有关,它会调取音频而不是继续增加无关图像。工具返回的是局部证据,模型据此决定继续搜索还是作答。
这种按需流程把“存储整部视频”和“回答当前问题”分开。外部索引保留大量信息,语言模型上下文只装问题、搜索记录和少量候选片段。论文报告,单样本智能体上下文约5万Token,远低于把所有细节直接展开的做法。
三项基准最低也有65.7%
VideoXAgent在Video-MME-Long达到85.1%,LVBench达到76.5%,MINERVA达到65.7%。三项基准的视频长度、问题类型和评分方式不同,因此这些数字应分别阅读,不能求一个简单平均后当作通用准确率。
论文图:VideoXAgent以约5万Token上下文取得较高准确率,并与直接装入更多上下文的方法比较。
LVBench结果还显示,代理式方案在长视频设置中优于多种对比方法。优势来自把计算用在与问题相关的片段,而不是承诺对整段视频形成无损记忆。
论文图:不同长视频方法在LVBench上的准确率对比,VideoXAgent位于代理方法一侧。
基准问题通常有明确答案和可定位证据。真实会议、监控或直播可能出现证据跨越多段、字幕错误、声音与画面冲突等情况;代理也可能第一步搜错方向,从而一路漏掉答案。
下一步要让搜索过程可检查
这类系统适合课程视频、会议归档、体育回放和企业素材库。部署时应保存每次工具调用、时间戳和引用片段,让用户能点击证据复核,而不是只收到一个无法追溯的答案。
后续研究需要测试搜索失败后的回退、多个问题共享缓存,以及视频更新后的索引一致性。若代理能说明“看了哪里、为什么相信”,长视频问答才会从基准分数走向可审计的工作工具。
参考资料
https://arxiv.org/abs/2609.12818