arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

百度让AI查小时级视频:只带5万Token,三项长视频测试达65.7%起

作者:arXivDaily编辑部 arXiv 2609.12818 cs · cs.AI · cs.CV

论文导读

百度提出VideoXAgent,让AI面对小时级视频时先按问题检索,再调用字幕、画面和音频工具取证。它用约5万Token智能体上下文,在Video-MME-Long、LVBench和MINERVA分别达到85.1%、76.5%和65.7%;结果来自三项基准,不代表任意长视频都能稳定回答。

长视频难点不是看不见,而是塞不下

处理几分钟视频时,模型可以均匀抽帧,把画面和字幕一次送入上下文。视频延长到一小时,帧数、字幕和声音线索迅速膨胀;盲目塞得更多会带来成本,也会让无关片段淹没真正证据。

VideoXAgent把模型变成检索代理。它先理解问题,估计答案可能出现的时间和模态,再选择查看字幕、视觉片段或音频,而不是从头到尾平均采样。每次查看结果都会更新下一步搜索范围。

项目图:智能体围绕问题调用长视频检索工具,逐步缩小时间区间并汇总多模态证据。

像查档案一样逐步找证据

如果问题问“跑步者什么时候到达”,代理可以先在字幕或粗粒度索引中定位相关时段,再查看到达前后的画面;如果问题与声音事件有关,它会调取音频而不是继续增加无关图像。工具返回的是局部证据,模型据此决定继续搜索还是作答。

这种按需流程把“存储整部视频”和“回答当前问题”分开。外部索引保留大量信息,语言模型上下文只装问题、搜索记录和少量候选片段。论文报告,单样本智能体上下文约5万Token,远低于把所有细节直接展开的做法。

三项基准最低也有65.7%

VideoXAgent在Video-MME-Long达到85.1%,LVBench达到76.5%,MINERVA达到65.7%。三项基准的视频长度、问题类型和评分方式不同,因此这些数字应分别阅读,不能求一个简单平均后当作通用准确率。

论文图:VideoXAgent以约5万Token上下文取得较高准确率,并与直接装入更多上下文的方法比较。

LVBench结果还显示,代理式方案在长视频设置中优于多种对比方法。优势来自把计算用在与问题相关的片段,而不是承诺对整段视频形成无损记忆。

论文图:不同长视频方法在LVBench上的准确率对比,VideoXAgent位于代理方法一侧。

基准问题通常有明确答案和可定位证据。真实会议、监控或直播可能出现证据跨越多段、字幕错误、声音与画面冲突等情况;代理也可能第一步搜错方向,从而一路漏掉答案。

下一步要让搜索过程可检查

这类系统适合课程视频、会议归档、体育回放和企业素材库。部署时应保存每次工具调用、时间戳和引用片段,让用户能点击证据复核,而不是只收到一个无法追溯的答案。

后续研究需要测试搜索失败后的回退、多个问题共享缓存,以及视频更新后的索引一致性。若代理能说明“看了哪里、为什么相信”,长视频问答才会从基准分数走向可审计的工作工具。

参考资料

https://arxiv.org/abs/2609.12818

https://arxiv.org/html/2609.12818

https://go-agent-x.github.io/video_agent_harness/