arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

快手可灵联手清华提出cIPO,不用人工标注让文生视频运动更真实

作者:arXivDaily编辑部 arXiv 2607.28058 cs · cs.CV

文生视频最容易露馅的地方,往往不是单帧画面,而是运动:手指突然融化、物体逐帧闪烁、转身时肢体结构错位。想靠偏好优化修正这些问题,传统做法要么请人逐条标注好坏视频,成本高昂;要么借助奖励模型打分,信号又常常不稳定。清华大学联合快手可灵团队(可灵Kling)、中山大学提出cIPO,一套完全不需要人工偏好标注的视频扩散模型后训练方法,把提升目标对准运动的时间一致性与物理自然度。

图1:cIPO不依赖人工标注或奖励模型,还能自动定位困难帧,生成视频的运动更连贯真实。

方法在Wan-VACE视频基座上以LoRA方式训练,分辨率240×416,学习率5e-6,并配合EMA参考模型做正则约束。人工评估中,cIPO在"自然物理"维度取得72.4%的胜率;在MotionBench与WISA两个基准上,帧真实性与物理一致性指标均为同组最优。

偏好信号从哪来:让模型重建自己的样本

偏好优化的核心是要有一对"好样本"和"坏样本"。离线人工标注贵,且标注者很难说清一段视频究竟在哪几帧开始崩坏;在线奖励模型虽然随训练动态更新,打分却容易偏、容易抖。cIPO的思路很直接:模型自己就知道哪里没生成好。

具体做法是,拿一段真实视频,先按扩散前向过程逐步加噪,再让模型从噪声出发一步步去噪、把视频重建回来。原始视频天然是更可信的"偏好样本",重建结果则是"不偏好样本"——重建得越吃力,说明模型在这段内容上越没把握。整个过程不需要任何人看视频、打标签,也不调用外部奖励模型,推理时的失误被直接转化成了训练信号。

图2:cIPO流水线分三步——重建真实视频构造隐式偏好对、按帧级重建误差定位困难帧、把偏好优化集中到高误差片段,全程在隐空间完成。

把监督集中到出错的那几帧

运动伪影通常只出现在短暂片段里:手物交互的一瞬、旋转动作的几帧。如果对整条视频均匀施加偏好损失,大量正确帧会稀释掉真正需要纠正的信号,这就是时间信用错配。

cIPO在重建时逐帧计算隐空间重建误差,误差曲线会明确指出模型在哪些去噪时刻、哪些帧上开始"掉队"。优化据此集中到高误差的时间窗口,已经生成正确的内容则尽量保持不动。这种做法带来两个好处:困难片段获得更密的梯度,正确片段不被过度修改,避免以往"整条视频一起调、好帧反而被带坏"的问题。训练目标采用IPO类偏好损失,要求可训练模型在偏好样本上相对不偏好样本取得更大改进,同时用Δ=0.1的EMA参考模型约束模型别偏离基座太远,稳住已有的画面质量。

图3:不同噪声水平下的重建误差曲线,高误差区段正是模型最容易产生伪影、需要集中优化的位置。

两个基准上的量化结果

实验在MotionBench与WISA两套以运动和物理为核心的基准上进行,比较对象包括预训练基座、离线DPO、以真实视频为正样本的DPO变体以及DenseDPO。WISA上cIPO综合得分0.247,次优方法为0.226;其中取证真实性Forensic为0.931,全向真实性指标0.521,时间一致性0.983。MotionBench上帧真实性达到0.876;综合得分为0.168,而关闭DPO项时仅为0.161,说明偏好优化本身确实带来了增益,而非单纯引入真实数据的功劳。

图4:表1、表2汇总MotionBench与WISA上的真实性与运动质量指标,cIPO在多数项目上领先各基线。

定性对比中,基线方法在红框标注的高难运动区常出现手部交互不稳、旋转姿态跳变和结构扭曲;cIPO生成的对应片段过渡更平滑、物体几何更稳定,4×4案例网格中Ours一行基本看不到红框标记的伪影。

图5:多组提示词下的定性对比,红框标出运动困难区域,cIPO一行保持了更连贯的时间动态。

免标注走向生产落地前,还要跨几道坎

cIPO证明了一件事:模型对干净样本的重建误差,可以当作一把免费的"自检尺子",用来发现失败帧并驱动偏好对齐,这为视频后训练免去了昂贵的人工标注环节。对于可灵这类需要持续迭代的大规模生成系统,这种随取随用的信号尤其有吸引力。

但也要看清边界。重建误差衡量的是模型"能不能还原",本质是感知质量的代理,无法完全覆盖人类更高层的语义偏好——构图审美、内容是否符合提示词意图,重建得好未必代表选得对。目前验证也只集中在MotionBench与WISA两个基准、240×416分辨率的LoRA设置上,更高分辨率、更长时长和更多生成条件下的稳定性仍待检验。下一步若能把这种隐式信号与轻量语义反馈结合,并扩展到真实生产链路,免标注的运动质量优化或许会成为视频生成模型的标配环节。

参考资料

https://arxiv.org/abs/2607.28058

https://henglin-liu.github.io/cIPO_vis/