arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

20个世界模型参加反应力考试,视频逼真不代表世界会回应

arXiv 2608.02603 cs.CV

中国科学院自动化研究所、香港中文大学、清华大学等团队发布WorldExam,用1474个案例评测20个可控视频与世界模型。没有一款模型同时覆盖大量任务并保持稳定高表现,画质好、指令完成度高,也不保证场景会作出合理反应。

团队把评测从外观一路拆到反应性:视觉质量、控制遵循、空间一致性和世界反应。最后一层专门检查输入没有明说的后果,例如主体接触地形后是否受环境影响,目标驱动行为是否符合当前场景。

WorldExam从画面质量到世界反应的四层评测

论文图1:1474个案例覆盖相机、动作和语言三种控制接口。

三类模型擅长的事情不同

相机驱动模型擅长移动视角,却缺少让主体与场景动态互动的接口。动作驱动模型能更精确地控制角色,环境常像静态布景一样不响应。语言驱动模型更会生成互动结果,复杂控制指令的执行精度又较弱。

WorldExam因此没有把所有模型压进一个简单总分。八项任务分别落在静态场景和动态互动轨道,评测指标也根据控制方式调整,避免用相机运动能力替代物理互动能力。

四级能力、八项任务与评测指标的对应关系

论文图2:不同任务根据场景假设和模型接口分配到两条测试轨道。

反应必须来自当前场景

传统提示可以直接要求“角色跳过障碍”,模型只需复现文字中给出的结果。WorldExam会给出初始图像、控制信号和环境状态,再检查模型是否生成未被逐字说明、但由场景决定的合理后果。

动态交互测试案例的构建流程

论文图3:任务模板扩展成场景、控制输入和选项,候选初始图像还会经过人工筛选。

评测不只依赖视觉语言模型打分。主体控制和地形互动任务会恢复运动轨迹、估计水平面与位移,用几何量检查动作是否按要求发生,降低“画面看着差不多”带来的主观误判。

主体轨迹与地形互动的几何评测

论文图7:分割与三维估计用于恢复主体轨迹,并检查其与地面的关系。

排名会受接口和任务集合影响

20个模型的能力分叉说明,当前“世界模型”仍包含多条不同技术路线。某款模型在语言交互上领先,不代表它支持精确动作控制;另一款相机模型画面稳定,也不等于能推演环境后果。

WorldExam是诊断型基准,不是对世界理解能力的一次终局认证。1474个案例无法覆盖开放世界,自动几何估计也会引入误差。更可靠的阅读方式是查看模型在哪一层失分,再判断它是否适合具体用途。

参考资料

https://arxiv.org/abs/2608.02603

https://WorldExam.github.io