arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

让视频智能体自己改代码:四轮进化后准确率从38.44%升至51.47%

arXiv 2608.04587 cs.CV

阿里巴巴、浙江大学、北京航空航天大学和字节跳动团队发布MetaVideoAgent,让长视频问答智能体根据目标视频类型自动修改自己的处理流程。四轮进化后,八类视频的宏平均准确率从38.44%升到51.47%。

最终智能体比最强固定设计方案高6.39个百分点,每个问题使用74.47K Token和29.11帧,也少于论文对比的固定视频智能体。不过,为每一类视频完成进化平均要消耗354万Token。

固定视频智能体与自动进化方案的差异

论文图1:电商直播、体育比赛和剧情片的证据分布不同,固定工具链容易产生冗余或漏掉关键片段。

先找失败发生在哪一层

长视频问答不只靠语言推理。系统要先组织视频,再定位时间段、调用视觉或音频工具、维护工作记忆,最后生成答案。一次错误可能从早期定位传到后续推理,直接让模型“重写全部代码”很难判断改动是否有效。

MetaVideoAgent把流程拆成视频结构化、证据定位、感知、工作记忆和推理五个模块。教师智能体拿到正确答案和证据时间段后,检查学生轨迹,找出最早无法支持正确答案的步骤;诊断智能体再汇总多个样本的共同错误,把责任指向一个主要模块。

MetaVideoAgent的审查、诊断与更新循环

论文图2:教师审查失败轨迹,诊断器聚类原因,进化器只修改责任模块及必要依赖。

小测试通过后,才跑完整视频

完整执行长视频问答成本高。团队把局部失败裁成可独立运行的最小验证任务,例如只检查一个时间片的主体跟踪或位置关系。候选修改先过工程检查和小测试,再与旧版本进行完整进化集对比;只有整体表现达标才会晋级。

八类视频包括访谈、商品展示、软件操作、剧情、舞台、游戏、体育和课程。直播可能主要依赖音频,体育问题需要捕捉瞬间动作,剧情片则要求跨远距离镜头维护人物关系,因此每类数据分别进化一个智能体。

自动进化前后的典型失败案例

论文图3:进化后的模块分别修复事件顺序、位置关系和主体跟踪问题,并在留出样本上验证。

51.47%来自新基准,不是通用上限

VA-EvoBench为每类视频划分独立进化集和留出集。留出结果只在固定预算结束后用于报告,不参与选择、早停或回滚,这减少了对测试集反复调参的风险。

八类视频的预算与准确率曲线

论文图4:八种分布的收益和进化速度不同,粗线表示平均趋势及95%置信区间。

51.47%同时说明任务仍然很难,接近一半问题没有答对。基准由作者从既有数据构建,按分布分别进化也带来额外训练成本;遇到混合内容或新视频类型时,是否需要重新进化尚未充分验证。代码和数据在论文中承诺发布,当前结论仍属于作者报告的预印本结果。

参考资料

https://arxiv.org/abs/2608.04587

https://github.com/Alibaba-VELLDEPTH/MetaVideoAgent