arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

让深度研究智能体先看完视频再搜索,200道多跳题做到64%

arXiv 2608.03979 cs.AI · cs.CV

论文公开页面未披露作者机构。Video-DeepResearch团队研究的任务要求模型先在连续画面里找到人物或物体,再去网页补充外部知识;团队发现,现有智能体常跳过视觉工具直接搜索文字,或凭模型记忆作答。新系统因此分阶段开放工具,强制先完成跨帧视觉定位。

Video-DeepResearch从视频感知到网页探索的流程

论文图1:智能体先在视频中选择关键帧并定位实体,再进入开放网页检索。

搜索按钮不是一开始就能用

系统把感知和探索拆开。第一阶段只开放关键帧选择、裁剪和视觉搜索,模型必须从多个画面锁定实体;得到视觉证据后,第二阶段才开放网页Search和Visit工具。

这种权限顺序针对两种捷径。其一是模态偏见:有文字搜索就不认真看视频;其二是参数知识泄漏:答案已经记在模型权重里,工具调用只做表面动作。训练数据还会过滤无需视频即可回答的问题。

200道题覆盖六类视频

VideoDR-Bench包含200道复杂多跳问答,知识类占29.5%,娱乐22.0%,日常生活18.5%,游戏与体育14.5%,新闻12.0%,其他3.5%。每题都要求视觉定位和外部知识推理共同参与。

VideoDR-Bench的六类视频分布

论文图2:基准覆盖知识、娱乐、生活、体育、新闻等六类视频。

团队先用规则和智能体筛选原始视频,再抽取关键帧、裁剪实体,生成单实体或多实体问题。只有正确执行的工具轨迹进入训练,模型先做监督微调,再用GRPO强化学习继续探索。

VideoDR-Bench数据与训练轨迹构建

论文图3:数据经过视频过滤、实体定位、问题生成、泄漏检查和正确轨迹筛选。

64%领先来自团队自建基准

Video-DeepResearch-35B-A3B在VideoDR-Bench取得64.0%平均准确率。论文对照中,Claude-4.5-Sonnet为59.0%,Gemini 2.5 Pro为57.5%,GPT-5为52.5%;较小的30B-A3B版本达到59.3%。

这些数字受工具实现、调用预算、提示词和裁判方式影响。基准只有200题,由同一研究项目构建,尚缺少独立复测。领先5个百分点不能写成对专有模型的通用能力超越。

论文验证的改进集中在任务流程:先固定视觉证据,再允许开放搜索。若视频很长、画面模糊或关键实体从未进入抽取帧,后续网页研究再充分也无法补回缺失观察。

参考资料

https://arxiv.org/abs/2608.03979

https://github.com/Osilly/Vision-DeepResearch