香港中文大学、蚂蚁集团和清华大学等机构联合发布VideoGAIA,把视频问答从“看完选答案”改成多轮调查:模型要反复观察视频、调用外部工具、搜索开放世界信息并整合证据。271项任务中,包括GPT-5.5和Kimi-K3在内的所有受测模型准确率均低于60%。
传统Video-MME等榜单上,领先模型准确率已接近90%。但这类题通常是单轮、封闭答案,证据直接位于视频内部。真实助手面对的请求更像“主持人拿起的手机采用哪款芯片”,既要定位画面中的型号,还要继续查询产品资料,单靠识别像素无法完成。
从单轮选择题变成多轮证据调查
VideoGAIA允许模型在多轮交互中调用视频检索、网页搜索等工具。它需要决定先看哪个时间段、缺少什么外部事实、工具返回的信息是否能和画面中的人物或物品对应,最后给出开放式答案。
VideoGAIA要求模型从视频片段出发,继续调用工具查找开放世界证据。
这改变了错误来源。模型可能第一步就找错时间,也可能认出对象却提出无效搜索词,或拿到正确网页后没有把信息与视频证据连接起来。单个工具调用看似成功,整条推理链仍会因为早期偏差而失败。
271项任务由模型和人共同设计
基准覆盖日常生活、文化、历史、地理、技术和经济等场景。研究团队先结合模型生成与人工设计形成候选,再由三名专家分别检查视频、问题和答案,减少开放式问题中常见的歧义与不可验证答案。
VideoGAIA的数据构建与三人独立复核流程。
题目难度不只来自视频长度。部分任务需要跨多个片段追踪对象,部分要识别画面中的细节后查询外部知识,还有一些要求比较不同时间出现的信息。每道题都保留可执行的证据路径,便于判断模型到底卡在观察、工具还是整合阶段。
前沿模型仍被长链条错误拖住
所有受测多模态模型在VideoGAIA上均未达到60%。这个数字不能与普通视频问答准确率直接横比:任务形式、工具权限和答案空间都不同。论文的重点正是说明,当视觉理解成为连续智能体流程的一环,单轮榜单成绩无法预测最终完成率。
VideoGAIA的任务分布和不同类别统计。
案例分析显示,有的模型能定位正确画面,却在外部搜索中选择了相似产品;有的找到有效资料,却忽略视频中的限定条件。增加工具本身不必然提高成绩,模型还需要知道何时停止搜索,以及如何保存跨轮证据而不被新信息带偏。
VideoGAIA还把评测单位从“最终答案”扩展到行动轨迹。研究者可以逐步查看模型调用了什么工具、检索了哪个片段、拿到了哪些网页信息,从而区分观察错误、检索错误和推理错误。对于智能体研究,这比一个笼统的错误答案更有诊断价值:如果大部分失败来自视频定位,就应改进时序检索;如果模型已经找到证据却答错,问题更可能出在跨来源整合。
271项任务的规模也提示了使用边界。它足以暴露当前前沿模型在开放式视频调查中的系统性短板,却不适合据此给通用多模态能力下最终排名。不同模型的工具接口、搜索策略和上下文长度都会影响结果,论文比较的是统一实验设置下的完成能力。
一个VideoGAIA案例展示从视频观察到工具查证的完整链条。
下一步是让视频助手留下可核验轨迹
VideoGAIA适合评测新闻核查、体育回放分析、教学视频检索和长视频研究助手,但它仍是271项人工筛选任务,不能代表所有现实视频工作。模型对网页变化、工具故障和更长对话的鲁棒性还需要单独测试。
更接近产品的方向,是让助手同时交付答案、关键时间戳和外部证据,并允许用户回看每一步。准确率提升之外,证据轨迹是否完整、错误能否被快速定位,将决定这类视频智能体能否用于专业内容分析。
这也是基准最值得持续追踪的部分。
参考资料
https://arxiv.org/abs/2608.14718