arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

视频生成到一半还能改物体速度,宾大、Snap把运动误差降12%

作者:arXivDaily编辑部 arXiv 2609.17521 cs · cs.AI · cs.CV · cs.GR

论文导读

宾夕法尼亚大学、Snap、阿卜杜拉国王科技大学提出PhysStream,让视频生成不必在开始前写死全部动作。用户可以在生成过程中给某个物体追加速度方向,模型再继续合成多物体运动。它用位置图和跟踪图保存场景状态,在合成基准上将运动分布距离降低33%、轨迹误差降低12%,并能处理中途改向。

控制动作不再等于拖着物体走

许多可控视频方法要求用户提前画完整轨迹,生成开始后不能再改。另一些方法直接指定物体每一帧的位置,看似精确,却把结果路径全部写死,模型没有学习速度变化、碰撞和后续运动之间的关系。

PhysStream改用稀疏的速度增量信号。用户在某个时间点选择物体并给出方向变化,模型根据当前状态继续生成。碟子可以中途转向撞倒花瓶,纸青蛙能连续跳向不同木桩,多个物体也可在不同时间收到控制。

论文Figure 1:箭头表示用户在不同时间加入的速度变化,后续帧由模型自回归生成。

每生成一帧,就更新一次场景记忆

只看首帧不足以维持长运动。物体离开原位置后,初始掩码已经过时;多个物体相互遮挡,模型还可能忘记谁刚才往哪里走。

PhysStream从最近生成帧在线估计两类结构化记忆:位置图记录场景几何,跟踪图更新物体区域。下一帧生成同时读取速度控制和当前记忆,完成后再把新画面送回估计器。这个循环让控制信号针对当前场景生效,而不是始终对着第一帧操作。

论文Figure 2:速度增量、位置图和跟踪图共同约束下一帧,新生成画面再用于更新场景记忆。

轨迹误差降12%,中途转向依赖跟踪图

在合成多物体刚体基准上,PhysStream相对最强对比方法把FVMD运动分布距离降低33%,轨迹误差降低12%。论文消融还展示,同样的之字形控制下,没有跟踪图的配置会漂移或卡在最后一次转向,加入跟踪图后才能完成完整路径。

论文Figure 5:同一交互条件下,多种基线与PhysStream在多物体刚体场景中的连续帧对比。

在论文的真实世界图片测试中,人类评审超过85%的比较更偏好PhysStream结果。这里的“真实世界”指真实图片作为输入后的生成视频,不是对真实物理过程的测量。主要量化实验仍集中在桌面刚体和合成基准,液体、软体与复杂碰撞还没有得到同等验证。

交互式视频的落地还要补上约束与回退

中途控制适合动画预演、教育演示和快速场景设计。进入编辑工具前,系统还需要检测穿模、物体消失和速度突变,并在新指令破坏既有运动时允许回退。PhysStream已经证明速度量可以成为控制接口,下一步是让多次修改保持时间一致,并把失败反馈明确交给创作者。

参考资料

https://arxiv.org/abs/2609.17521

https://czzzzh.github.io/PhysStream/