让视频模型把绳结解开、让齿轮按规则转动,或沿迷宫走到出口,画面好看不等于过程正确。微软研究院、清华大学、麻省理工学院、伊利诺伊大学厄巴纳-香槟分校等机构提出VGI-Bench,用27项任务、810个实例测试视频生成模型能否通过连续画面完成视觉推理。
论文评测的最强模型Seedance 2.0总分为51.0;Sora 2得到36.7,Veo 3.1为32.0。结果显示,现有模型能解决部分任务,但对多步规则、连接关系和状态变化仍不稳定。
终点看起来正确,过程违规仍然失败
许多生成评测只检查最后一帧。模型可以让积木最终落到目标位置,却在中途让物体穿透桌面;也可以画出解开的绳结,却没有生成连续、可行的解结过程。VGI-Bench把这类“结果像对、过程不对”单独拦截。
基准分为视觉组织、物理操作、结构化谜题和时空动态四个领域,并用空间、时间、规划、属性定位、物理、拓扑和可供性七类技能标签描述任务。每项任务设置三个难度,大致各含10个实例。
27项任务包含积木拼装、工具使用、齿轮、汉诺塔、迷宫和拼图等可视过程。
团队在正式收录任务前先让多款模型试做两个最简单实例。至少一个模型能成功、至少一个模型失败,任务才会保留。这个筛选避免基准充满当前模型完全做不到的问题,也避免只测毫无区分度的简单动画。
完成度与规则检查相乘得到总分
每个输出首先按完成、部分完成、失败三个等级判断目标进度。随后,评测器以更高帧率检查局部违规,例如积木是否瞬移、物体数量是否改变、绳结是否凭空断开。最终分数由完成度与规则分相乘,任一项很低都会拉低结果。
主实验因生成成本抽取每项任务一半实例,并用Gemini-3-Flash作为自动评测器。视频以2帧每秒判断整体完成度;规则检查先以4帧每秒定位可疑区间,再将局部提高到8帧每秒复核。论文另做人工相关性和全量稳定性分析。
论文沿去噪轨迹观察迷宫解答,后期主要细化早期方案。
自动评测仍是一项实验边界。51.0是这套任务、抽样和评分规则下的总分,不能直接解释为模型拥有51%的通用智能,也不能与其他视频基准的百分数直接比较。
商业模型领先,但结构化谜题仍最难
Seedance 2.0在四个领域的平均分分别为60.8、45.3、44.6和56.0,总分51.0。Kling 3.0得到44.0,MiniMax-H3为44.4;开源模型HunyuanVideo-1.5、Wan 2.2分别为19.1和21.6。商业系统总体领先,但没有模型接近解决全部任务。
技能拆分显示,拓扑和时间能力最弱。模型容易改变绳、链条和路径的连接关系,也难以在多个步骤中维持一致状态。结构化谜题对规则执行要求更高,因此成为四个领域中最难的一组。
早期去噪阶段已形成主要路径,后续步骤很少彻底纠正错误方向。
团队观察模型内部去噪过程后发现,后期步骤通常是在细化早期假设,而不是推翻错误推理。模型若一开始选错路径,画面会越来越清晰,逻辑却未必得到修正。
下一步:让视觉推理评测更可复现
同一任务换成线稿或写实输入,模型表现会明显变化,开源模型对视觉风格差异尤其敏感。大规模合成数据微调能够把部分能力迁移到写实任务,但提升受训练数据是否覆盖目标技能约束,单纯增加样本量不能补齐所有推理类型。
论文附录中的汉诺塔案例用于分析过程规则与最终状态之间的差异。
VGI-Bench的直接用途是诊断视频模型:开发者可以分清模型是在物理交互、拓扑保持还是多步规划上失分,再针对性补数据和评测。对于把视频生成器当作世界模型的机器人研究,过程有效性比单帧画质更接近实际需求。
下一阶段需要降低自动评测误差,并扩大真人复核和跨版本复现。团队表示将发布代码和数据;在这些资源完整公开前,第三方仍需核对任务材料、模型配置和调用版本,才能复现排行榜。
参考资料
https://arxiv.org/abs/2608.19583