论文导读
哈尔滨工业大学与阿里巴巴淘宝提出CompAdapt,让视频生成模型处理耦合运动、多阶段转换和多物体碰撞,并能用一个样例适应新的物理环境。目标不是只让单个物体移动得像,而是让连续事件彼此接得上。
复杂物理最容易在事件交界处露馅
现有视频模型可以生成球落下、物体滑动等短动作,但多个规律连续发生时,错误会迅速累积。一个球先沿斜坡滚动、再碰撞另一个物体、随后改变方向,模型既要保持外观,也要让速度、接触和因果顺序一致。
CompAdapt将这类任务称为复合物理行为。它不把视频只看成一串外观相近的帧,而是引入动态先验,约束不同阶段的运动关系。自然语言负责描述场景和事件,运动信息则帮助生成器在关键转换点保持连续。
图:论文案例覆盖耦合运动、多阶段变化与多物体碰撞。
用动态先验连接提示词和生成轨迹
框架先从参考或物理过程提取动态模式,再把它与文本、视觉条件一起注入视频生成。对于新环境,系统通过动态先验匹配找到相近运动,只需一个样例就能做one-shot适应,不必重训整个核心模型。
这种设计把“物体长什么样”和“物体怎样动”部分分开。新场景可以改变背景、材质和视角,同时复用运动规律;当目标过程包含多个阶段时,各阶段的条件按时间连接,减少模型在转折处突然改变轨迹。
图:论文方法图展示动态先验的提取、匹配与生成条件注入。
基准领先不等于视频模型已经懂物理
论文在物理聚焦基准和项目演示中报告,CompAdapt的物理一致性优于通用与物理约束基线,同时保持视觉质量。一次适应也让系统能迁移到未见环境,说明显式运动条件对复合事件有效。
但这些测试仍是受控场景。模型生成的轨迹符合样例,不代表它学会了可外推的物理方程;遮挡、软体、流体、摩擦变化或很长时间跨度都可能超出设定。视觉上“像真的”也不能代替位置、速度、能量等量化核验。
图:论文结果比较CompAdapt与多种基线在物理和画面指标上的表现。
未来应用:先服务可控内容,再挑战开放世界
短期内,这类方法适合广告预演、教育动画和游戏素材:创作者给出一个运动示例,再更换物体和背景,快速获得遵循相似节奏的视频。对于工程仿真或安全决策,生成结果仍不能替代经过验证的物理模拟器。
后续评测应从单个视频指标扩展到轨迹误差、碰撞时刻、守恒关系和跨时长稳定性,并公开失败案例。还可以让同一物理条件在多种外观下重复生成,检查模型到底复用了运动规律,还是记住了样例画面。
真正的进展不只是让球“看起来会滚”,而是让多个事件在变化环境里仍遵守一致规则。CompAdapt把复合过程和快速适应放进同一框架,为可控视频迈出一步,也清楚暴露了生成模型与可信仿真之间仍然存在的距离。