香港科技大学、浙江大学、香港中文大学和斯坦福大学团队发布FlexComposer。用户提供背景视频、前景图片或视频,再画一条移动轨迹,模型会把素材放进场景,同时生成遮挡、光照、阴影和反射变化。
静态商品图可以被转成移动物体,已有动作的视频素材也能保留内部运动,例如蝴蝶扇动翅膀或爆炸继续扩张。论文没有使用显式三维场景重建,也没有为注入位置另加可学习适配器。
论文图1:静态前景会生成视角与运动变化,动态前景则尽量保留原有动作。
先把物体动作和移动路线拆开
现有方法常在两种能力之间取舍:图片生成视频可以让静态物体动起来,却容易改变物体身份;传统视频合成能保留动作,但很难让素材精确沿用户指定路线移动。
FlexComposer先把前景变换到稳定、居中的统一表示。物体自身动作留在这个表示中,整体位移则交给外部轨迹控制。处理动态视频时,系统先估计并移除画面中的全局移动;处理静态图时,则扩展出可供视频模型使用的时序表示。
论文图2:前景先进入统一表示,再沿三维轨迹注入背景视频的潜空间。
注入阶段利用视频VAE潜空间的平移特性,把前景特征搬到每个时间点对应的位置。可见性门控会在物体被遮挡时降低注入强度,避免前景始终浮在背景上方。
训练混合了程序数据、真实镜头和生成素材
模型基于Wan2.1-I2V-14B,并从Wan-Move权重开始训练。团队在DiT投影层加入rank 64的LoRA,使用32张英伟达A100训练。这个配置说明论文展示的是研究级视频生成系统,不是普通电脑上的轻量工具。
数据课程分三段:程序生成数据负责建立轨迹和遮挡关系,真实电影镜头用于适应真实光照,生成数据用于扩充物体与场景组合。消融实验中,只用合成数据的FVD为154.2,完整模型降至79.8;移除统一表示或潜空间搬运后,轨迹误差明显上升。
论文图3:对比集中在复杂遮挡、轨迹跟随和前景身份保持。
DAVIS测试的轨迹误差降到2.15
在DAVIS数据集的动态前景设置中,FlexComposer的端点误差EPE为2.15,Wan-Move为2.50;FVD分别为82.6和94.3。MoveBench上,动态版本的FVD为74.9,论文列出的最好对照为83.5。
25名评估者还比较了20个随机案例。对Kling 1.5时,87.6%的轨迹控制选择偏向FlexComposer;视觉协调和身份保持的偏好率分别为57.2%和55.4%。这组用户研究衡量相对偏好,不能替代真实剪辑流程中的效率和可控性测试。
论文图6:模型会随背景调整前景色彩,并尝试补出阴影与反射。
画面融合不等于理解物理
论文明确写出,阴影和光照可以被生成,物体碰撞却没有物理模拟,结果依赖扩散模型学到的视觉先验。长视频遇到大幅视角变化时,物体身份和结构也会失去一致性。
FlexComposer已经证明静态图和动态视频可以放进同一条生成式合成流程。真正进入广告、影视和电商制作,还要补上精确碰撞、长镜头稳定性、可重复编辑和生成成本数据。