Adobe与加州大学圣迭戈分校提出潜动力学推理LDR,让视频世界模型不只生成“看起来合理”的下一帧,而是显式学习物体随时间的运动规律。
在匀速、抛物线、碰撞、弹跳和近大远小五类受控任务上,LDR的分布内与分布外误差差距比视频扩散基线小20倍以上。它的参数量少26倍,在A100上预测32帧时运行快143倍。
像素对了,运动规律也可能错了
视频扩散模型擅长拟合训练分布中的画面,但训练中没见过的速度、方向或物体一出现,它可能继续生成清晰帧,却让轨迹偏离物理过程。团队因此不只看视觉质量,还从预测帧提取位置和半径,直接测量运动误差。
LDR在新速度和新外观下保持运动轨迹,对比模型的误差图更明显。
只让神经网络回归高阶残差
LDR先把三帧条件图像编码成结构化潜变量,再估计状态的低阶时间导数。位置、速度等低阶部分由数值积分向前滚动,神经网络只回归三阶及更高阶的残差,最后解码为RGB帧。
结构化潜变量同样关键。密集卷积特征会把物体和背景混在大量网格中,而LDR用更紧凑的状态执行积分,实验中去掉这个设计后,分布外外推明显变差。
LDR将低阶动力学交给数值积分,模型专注预测高阶残差。
从红球向右跑,外推到蓝色方块向左跑
压力测试把外观和运动同时改掉:模型只看过红球从左向右运动,测试时则改成未见过的蓝色方块从右向左运动。LDR仍能预测正确方向,而基线和消融版本出现轨迹错误。论文还用地球、卡通角色等新对象验证外观迁移。
LDR在训练分布外的速度、方向和外观下仍保持正确动态。
联合训练时,一个模型同时处理五种任务,LDR仍保持相同趋势。这说明它学到的不只是某个动画模板,而是能在结构化状态中组合多类运动。
五项任务各自检查不同动力学要素。匀速运动看模型能否外推新速度,抛物线考察两个方向的加速度,碰撞将评估分为全时窗和碰撞后时窗,弹跳检查边界上的速度反转,近大远小则用半径变化代表深度方向运动。这种白盒设置能直接说明模型究竟错在哪条运动规律上。
表格同时报告128×128和256×256两种分辨率,以及单任务与五任务联合训练。LDR的优势不依赖某一个分辨率或只给模型看一类运动。消融版本分别移除结构化潜表示和运动学积分,两者在分布外测试上都会扩大误差,说明效果不是单靠更小网络得到。
效率表在一张A100-80G上以32帧片段测量,扩散基线使用50步DDIM采样。LDR的143倍速度优势与参数减少26倍就来自这个明确设置:它用递归积分直接向前滚动,不必为每段未来视频反复去噪几十次。
下一步扩展到真实世界与长时程视频
从表示层面看,LDR还需要回答结构化潜状态在物体数量增加、遮挡时间变长和相机自身移动时能否继续稳定解耦。受控球体任务中,位置与半径可以从画面准确提取;换成非刚体、人体或室外场景后,测量动力学正确性本身就会更难。
另一个值得观察的方向是与语言条件结合,让模型不只外推画面中已经发生的运动,还能按指令比较多种未来动力学分支。
当前证据来自256×256分辨率的白盒物理基准,五类任务能清楚区分模型是否真正学到动力学,却还不包含真实场景的遮挡、镜头运动和多物体长期交互。
同一模型同时学习五类运动时,LDR的外推轨迹仍更接近真值。
下一步的价值在于把这种“规律与画面分工”的思路接到更复杂的世界模型,验证它能否在机器人预测、视频规划和长时间交互中继续保持外推能力。