arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Adobe上海AI Lab等开源HPSD:让图生视频当老师,把文生视频自己的基本功教强

arXiv 2608.13205 cs.CV

图生视频有一张高质量首帧做视觉锚点,通常比只靠一句提示词更容易生成稳定画面。Adobe、上海人工智能实验室、上海交通大学、南洋理工大学和复旦大学等团队开源HPSD,让同一个图文生视频模型先以“带首帧老师”提供高质量方向,再让纯文本学生沿自己的生成轨迹继续优化。

直接用奖励模型训练文生视频,常遇到两个问题:优秀样本稀少,梯度容易被低质量探索带偏;如果完全模仿图生视频教师,学生又会依赖推理时不存在的首帧。HPSD的关键是在教师稳定性和学生真实分布之间搭桥。

同一模型扮演老师与学生,条件不同、能力相通

教师侧使用图文生视频模式:输入增强后的提示词与高质量首帧,生成结构更稳定、主体更明确的视频。学生侧使用纯文生视频模式,只看到原始提示词。由于两者共享同一基础模型,教师提供的并非另一个陌生系统的动作,而是模型在更充分条件下能够达到的视觉上限。

HPSD中文生视频学生向带高质量首帧的教师学习

HPSD中文生视频学生向带高质量首帧的教师学习。

首帧相当于把构图、身份和颜色先固定下来,使后续运动学习更容易。教师样本因此可以作为离策略锚点,告诉学生什么样的结果值得靠近。但学生推理时没有这张图,所以训练不能停在逐帧复刻,还需要在纯文本条件下形成自己的生成能力。

混合策略把教师锚点与学生探索放进同一轮更新

HPSD采用混合偏好优化。一部分数据来自教师生成的高质量轨迹,提供稳定的离策略参考;另一部分从学生当前输出出发,在局部进行在线细化。前者防止训练早期四处乱跑,后者减少“训练时看过首帧、推理时没有”的分布差异。

HPSD结合离策略教师锚点与学生在线轨迹的训练流程

HPSD结合离策略教师锚点与学生在线轨迹的训练流程。

奖励信号会比较视觉质量、文本一致性和运动效果,学生不只是复制某一个视频,而是在多种候选中学会偏好。增强提示词只提供给教师,原始提示词留给学生,使最终模型面对普通用户输入时仍能工作。这个设计也避免要求人工为每条文字提示准备真实首帧。

纯文本与图生视频能力可以同步提高

论文在多种视频生成设置中报告,HPSD不仅提升目标文生视频任务,也能改善图生视频表现。直观上,学生从教师学到更好的构图和主体保持,而在线轨迹又让模型熟悉没有首帧时的运动与细节补全。两种模式共享表示,优化收益可以反向流动。

HPSD在人物、动物和复杂运动提示上的生成对比

HPSD在人物、动物和复杂运动提示上的生成对比。

HPSD在不同场景中的文生视频细节与运动表现

HPSD在不同场景中的文生视频细节与运动表现。

论文摘要没有给出一个可概括所有数据集和指标的单一提升数字,效果应按各基准、基础模型与奖励配置理解。它的主要贡献是训练路径:利用同一模型更容易的条件分支,去教强更困难的条件分支,同时保留学生自己的在线探索。

下一步扩展为多条件视频模型的自我教学

这套方法不必局限于首帧。未来可以让带深度、姿态、分割或相机轨迹的分支担任教师,再把能力蒸馏到只接收文本的通用模型;也可以反过来,用强文本语义帮助弱条件分支理解复杂指令。不同输入模式因此不再是独立训练的产品,而能成为互相提供课程的同一模型家族。

在创作工具中,HPSD还可以形成“先精确后自由”的工作流:有参考图时生成高质量候选,没有参考图时仍保持可靠构图。开源实现为研究者提供了可复现起点,后续若加入更稳健的奖励集成、版权数据过滤与人工偏好控制,混合蒸馏有望降低视频模型持续对齐的样本成本。

对模型迭代而言,教师还可以随学生一起更新:先用当前最佳图生视频分支产生锚点,学生提升后再反过来贡献更好的运动样本。为避免两个分支互相放大偏差,需要保留固定验证集和人工抽检,分别报告文本遵循、身份稳定、运动幅度与视觉质量。这样,自我教学才会形成可度量的正循环。

参考资料

https://arxiv.org/abs/2608.13205

https://zhang-zijie.github.io/HPSD/

https://github.com/zhang-zijie/HPSD