剑桥大学团队提出RigidBench,用模拟器给视频生成模型建立可核对的刚体运动标准答案。8款模型在同一批100个样本上接受10项测量,没有一个模型在全部指标领先;更反常的是,模型平均SSIM越高,3D轨迹误差反而越大,相关系数达到0.89。
视频世界模型常被用来预测“接下来会发生什么”。普通画质指标比较整帧像素或视觉特征,背景、光照和纹理会占据大量权重。一颗球弹错方向,只要房间和桌面画得足够像,总分仍可能很好看。
五类任务把不同物理错误拆开测
RigidBench建立自由落体、弹跳、斜坡碰撞、球链和物体落入集群等五类任务。模拟器为每帧保存遮罩、深度、六自由度轨迹和接触状态,生成视频可以与相同初始画面、相同运动描述下的参考轨迹逐项比较。
球链任务检查连接物体的运动、碰撞与空间轨迹。
10项指标分别关注运动、几何、物体身份、背景稳定和视觉相似度,避免用一个总分掩盖不同错误。100个样本覆盖不同物体、材质、视角和室内外环境,但规模仍有限,结论不能直接外推到流体、布料或复杂机器人交互。
画得更像不等于物体动得更对
8款模型的排名会随指标改变,没有一个在10项测量中全面领先。跨模型均值分析中,更高SSIM与更大的3D轨迹误差同时出现,相关系数为0.89。模型可能靠稳定背景和相似颜色提高像素分,却没有保持正确速度、方向和碰撞后轨迹。
弹跳场景要求模型同时保持球体身份、接触时刻和反弹轨迹。
这并不说明SSIM毫无价值,而是它回答的是画面相似性问题。若视频用于内容创作,视觉观感可能最重要;若充当机器人规划或自动驾驶的预测器,物体未来位置和接触关系必须单独测量。
微调让3D轨迹更准,SSIM几乎不动
RigidBench还提供5000段带精确模拟器状态的训练视频。团队用它微调Wan 2.2 TI2V-5B,完整微调使3D轨迹误差降低约20%,SSIM几乎没有变化。这进一步证明物理改进可能不会反映在常见画质分数中。
多物体落入场景用于检查遮挡、碰撞和轨迹保持。
探针和干预实验显示,Wan扩散Transformer的多层都包含物体位置信息,并在去噪过程中使用这些信息。问题不是模型完全没有编码位置,而是训练目标和生成过程没有稳定地把内部表示转成准确轨迹。
相关系数0.89是跨受测模型均值观察到的关系,不应解释成“提高SSIM必然导致物理变差”。它说明当前模型可能采用了有利于背景与纹理稳定、却不利于精确运动的不同折中。要确认因果关系,还需要控制架构、训练数据和采样策略进行更多实验。
5000段模拟视频的微调结果提供了另一条证据:3D轨迹误差改善约20%时,SSIM几乎不变。如果只盯着传统画质榜单,这次进步可能完全不可见。反过来,模型在某项视觉分数上的提升,也不能证明它学会了更准确的碰撞、重力或反弹规律。
RigidBench选择刚体,是因为模拟器可以给出可复核的精确状态。真实世界视频没有天然的六自由度真值,摄像机运动、遮挡与感知误差也会混在一起。未来把基准扩展到真实数据时,需要同时报告标定误差,避免把追踪器自身的偏差误判成生成模型的物理失败。
RigidBench对各模型的多项物理与视觉指标进行分离审计。
世界模型评测需要从画质走向任务后果
RigidBench为刚体视频提供了可复现起点。下一步可以加入更复杂接触、多物体遮挡、机器人动作和真实视频标定,并检查物理误差是否真正影响下游规划,而不是只在模拟指标上改善。
对于用视频模型做决策的系统,发布时同时报告视觉质量、轨迹、接触和身份稳定性会更有意义。一个画面漂亮但把物体预测到错误位置的模型,适合生成内容,却不应仅凭同一组分数被称为可靠世界模型。
这种分层报告更便于使用者判断风险。
参考资料
https://arxiv.org/abs/2608.15555