arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Adobe把6类视频生成编辑塞进一个模型,4步推理实现720p实时流式输出

作者:arXivDaily编辑部 arXiv 2608.21424 cs · cs.CV · cs.GR · cs.HC · cs.LG · cs.MM

同一个视频模型,既能从文字或图片生成画面,也能改角色、传递首帧编辑、转换已有视频和重新安排镜头。Adobe研究院、罗切斯特大学提出EditStream,把六类生成与编辑任务合进一套DiT权重,再将多步扩散过程压缩为4步自回归推理。论文评测中,单张H100生成720p视频达到10.56 FPS。

项目页把它定位为技术报告,代码、数据和模型仍标注为即将开放。现阶段可以核查的是论文给出的任务设计、演示和对比实验,不能把它写成已经上线的Adobe产品。

六类任务共用一套权重

EditStream覆盖文生视频、图生视频、视频转视频、编辑传播、参考图引导编辑和相机姿态变化。过去常见做法是为不同控制方式训练独立模型,或者不断把条件追加成更长的Token序列。团队改用两个条件入口:与输出像素一一对应的源视频、遮罩和相机变换沿通道维拼接;参考图这类没有像素对齐关系的条件才进入Token序列。

论文Figure 1:文字或图像生成、视频编辑、参考引导、首帧编辑传播和相机重拍由同一模型完成。

这套分流设计没有增加像素对齐条件的注意力序列长度。任务差别由提示词、任务标签、条件端口和遮罩共同表达,主干仍是同一套Wan2.2-TI2V-5B权重。

论文方法图:像素对齐条件走通道端口,参考图等非对齐条件进入Token端口。

先匹配速度矩,再让学生看自己的输出

把扩散模型压到很少的去噪步数,画面容易过饱和,运动幅度也会减弱。EditStream先用速度矩匹配,让学生模型在自己实际到达的中间状态学习教师模型的条件速度分布;第二阶段再进行自回归展开,让学生把前一段自己生成的结果当作下一段条件。

论文训练示意:VMM预热后进行自回归展开,显式训练模型处理自身预测带来的误差。

训练时,第一段视频没有历史预测可依赖,团队对它保留单独的稳定目标;后续区块则在闭环中学习。论文消融显示,只做初始化或沿用普通Self-Forcing,都更容易在长序列中出现颜色漂移和运动退化。

720p速度和质量要放在同一设置里看

速度测试使用单张H100,720p下为10.56 FPS。项目页展示了更高的流式吞吐表述,但论文实验数字有明确硬件和测量设置,本文采用论文结果。质量评估同时覆盖文本对齐、图像质量、主体一致性、运动和时间稳定性;4步学生模型并非在所有单项指标都超过多步教师。

论文把训练和评测片段统一为81帧,并按720p比例桶处理。速度数字测的是模型生成吞吐,不包含用户上传素材、文本编码、视频解码和导出文件的完整产品链路。交互工具的实际等待时间还会受到首段生成、显存调度与连续预览缓存影响。

参考图编辑示例显示,同一主体可以被带入目标视频,同时保留目标动作和场景。定性图只能证明作者展示的案例,不代表任意人物、遮挡和长镜头都能稳定保持身份。

论文参考引导编辑案例:输入视频、参考主体与不同方法输出的逐帧对比。

下一步是开放模型并接入真实剪辑流程

统一模型减少了创作工具在任务间切换权重的成本,适合把“生成一段—修改局部—调整镜头—继续生成”串成连续操作。论文已验证六种任务共享主干的可行性,产品端仍要处理显存、输入格式、版权审核和更长时间的一致性。

项目页尚未给出代码、数据与模型下载。后续最关键的核验点,是开放版本能否复现单卡速度、支持多轮编辑,并在用户反复修改时避免前面已经确认的内容被新一轮生成破坏。

对创作者而言,六类任务共享权重的直接价值是减少素材在不同模型之间反复编码。对研发团队而言,还要测量新增条件组合是否互相干扰,例如同时换主体、保留背景并修改相机轨迹时,单一端口设计能否维持论文中的质量。

参考资料

https://arxiv.org/abs/2608.21424

https://arxiv.org/html/2608.21424

https://real-time-video-research.github.io/editstream/