清华大学、南京大学、快手可灵团队、上海科技大学和香港科技大学提出ContextMaster。它把文字生成、参考图生成和视频编辑放进同一个多轮工作流,每次接受的新镜头都会加入历史,供后续镜头继续使用。
部署版本以Wan2.1-T2V-1.3B为底座,生成832×480、每镜头81帧的视频,四步去噪时在单张GPU上达到16 FPS。模型每次只读取相当于6帧的活动上下文,避免镜头越多、每一步注意力开销越大。
论文图1:同一模型支持文字续拍、参考图续拍、多镜头编辑以及混合操作,并报告单GPU 16 FPS。
参考图、旧镜头和待编辑视频各有位置
多镜头创作的输入并不等价。参考图规定人物外观,历史镜头保存身份和叙事状态,源视频提供与目标逐帧对齐的结构。若把它们简单拼在一条时间轴上,模型容易混淆“要保留的过去”和“这一轮要修改的素材”。
ContextMaster给不同输入分配角色和镜头编码。参考、历史、源视频与目标视频进入同一模型,但旋转位置编码会标明各自身份;编辑时,源视频和目标视频仍共享帧坐标,以保留动作与构图对齐。
论文图2:干净历史先生成可复用缓存,目标视频只从固定数量的相关上下文块中读取信息。
六帧预算里先保硬约束
模型不会按相同比例扫描不断增长的历史。ConstraintSink先为参考图和与目标对齐的源视频块预留位置,剩余预算再按内容相似度从历史中检索。上下文缓存每轮建立一次,在多次去噪中重复使用。
五镜头消融实验中,活动预算从2帧增至6帧后,跨镜头一致性从0.586升到0.836;继续增到8帧只到0.841,速度则从16.74 FPS降到16.18 FPS。团队因此选择6帧作为部署点。
论文图3:连续镜头展示角色视角变化、参考身份保持和跨镜头编辑效果。
固定读取不等于历史成本完全不增长
稀疏读取会遗漏细节,少步采样也容易积累画质误差。训练时,完整读取上下文的教师模型先把行为蒸馏给稀疏学生模型,再用部署时真实生成的轨迹做分布匹配,修复外观和编辑残留。
论文图4:去掉角色编码或ConstraintSink后,删除物体时更容易留下源视频残影。
论文仍有一个明确成本:目标对历史的重复读取被固定,但每轮开始时,系统还要对全部累计历史做双向预填充。测试中每增加一个镜头,吞吐约下降0.4 FPS。训练还使用约100万段内部多镜头视频和64张H200,数据与算力条件限制了外部复现。