论文导读
斯坦福大学、约翰斯·霍普金斯大学、麻省理工学院、马克斯·普朗克智能系统研究所等机构提出4DCodeBench,让AI观看视频并编写能重建场景运动的图形代码。18个模型在200个场景中接受检验,榜首模型静态成绩0.91、动态0.67。评测把外观、几何和运动分开,显示“搭得像”与“动得对”的差距。
给AI一段视频,交回能运行的场景
一团液体流动、柔软物体形变、物件破碎,视频模型可以直接生成相似画面。4DCodeBench要求的是另一种输出:代理必须写出图形程序,定义三维结构、随时间的变化和渲染方式,再把场景生成回视频。
程序还要暴露逐帧几何和运动对应关系,方便检查它到底建了什么。只交一段视觉上接近的成品视频,不满足任务要求;通过程序读取参考视频再播放,也不能代替从头重建。
200个任务由100段真实视频和100个合成场景组成。合成部分有可核对的几何与动态真值,真实部分则增加了从画面推断结构、材料和运动的难度。
图:刚性、可变形、薄结构和流体的真实与合成场景样例。
外观像了,再查几何和运动
每个代理可以使用图形工具、模拟库或自己的代码。论文没有强制采用物理模拟,手工写运动轨迹也能提交,这便于观察模型会主动选择什么表达方式。
评测拆为视觉观感、二维运动、带深度的几何、三维几何和三维动态五类,综合分为这些成绩的平均值。另外还有针对具体场景事件的问题检查与人工偏好比较,避免只靠一张好看的截图判断。
人工研究覆盖17个模型,76名参与者给出3587次成对判断。人工与模型评审排名高度相关,但接近水平的两个模型仍可能难以稳定区分,排名不能替代每个场景的具体检查。
图中的参考视频和模型重建覆盖不同物体与运动类型,可以逐个检查外形、姿态和运动过程是否对应。
图:参考场景与不同模型对三维结构、运动的重建画面。
静态0.91,动态0.67,差距留在运动上
所评18个模型中,GPT-6 Astra最高推理配置位于综合榜首。它的静态两类平均成绩为0.91,动态两类平均为0.67;整个模型组也普遍更擅长恢复外观和几何,而非准确的运动过程。
整体提交中,90.1%能够完整执行;缺少有效输出的任务,相关指标按最差值处理。程序能跑只是第一关,是否抓对物体关系、关键事件和运动轨迹,还要分别计分。
很多重建依赖手工设定的轨迹,真正使用物理模拟的比例较低。单个模型增加推理投入,有时会更多采用模拟并改善运动,但跨模型比较时,花更多token并不稳定对应更好的重建成绩。
图:每个模型静态与动态平均成绩及置信区间的差距。
下一步:换初始条件,才能继续检验物理理解
图形代码适合被检查和修改,也让动态场景重建有了比单纯视频输出更明确的接口。评测提供了观察模型怎样把视觉线索变成可执行表示的方法。
当前评分关注复现原视频,预设轨迹同样可能得到高分。后续可改变初始条件、外力或预测时长,检查程序能否合理响应;还可追踪代理每轮渲染后的修正过程,量化反馈究竟改善了哪些几何与运动问题。
参考资料
https://arxiv.org/abs/2610.03715