论文导读
Adobe研究院、捷克理工大学等机构提出MemComposer,让AI记住拍摄素材,再按文字要求生成补充镜头。对比无素材参考方案,用户更偏好它与原片的视觉对齐。系统先规划镜头、检索人物和场景,再生成原片没有的画面,沿用影片的视觉信息。
补镜头之前,先认清原片里的人和地方
MemComposer处理的是补充镜头序列:用户给出自己的视频素材、想要的内容和时长,系统生成能与主片搭配的多镜头画面。项目展示了从十余小时素材中组织参考信息的流程。
单靠文字生成,可能出现一个合理却完全陌生的人物或场所。直接搜索旧素材又受到拍摄范围限制:用户要求某个动作或视角,当时没有拍,就找不到真正满足要求的镜头。
系统先离线构建素材记忆,把人物、场景、物体与风格分开记录,保留适合生成使用的参考帧。人物参考还区分较稳定的外观和临时状态,避免把某一帧里的动作误当成永久身份特征。
图:项目方法图将素材记忆构建、镜头计划与参考检索、关键帧生成和检查串成三个阶段。
每个镜头都带着参考进生成器
收到请求后,系统把内容拆成镜头计划,安排景别、相机运动和时长,再为每一镜检索人物与环境参考。检索不仅比较描述是否相似,还检查参考里的人物身份是否符合该镜头要求。
生成从关键帧开始,后续镜头结合已有内容保持连续。局部检查器核对人物与场景,整段检查器再看重复镜头、跨镜头身份漂移和节奏问题,需要时重新生成指定部分。
通过检查后,关键帧被动画化并拼接。静止或推近镜头采用首帧驱动;环绕或跟拍会露出画面外区域,则加入额外参考。实验用Gemini完成记忆、规划和视觉检查,视频生成使用Veo 3.1。
用户偏好来自39条剪辑请求
实验取五个纪录片项目,抽取39条用户请求,平均目标时长19.1秒。286名参与者分别比较两件事:内容是否遵循文字要求,以及是否贴近原素材的视觉世界,每对视频平均约有五次独立评价。
相比没有素材参考的文字生成规划方案,MemComposer在内容遵循比较中获得60.0%偏好,在视觉对齐比较中为92.8%。这两个比例描述的是用户二选一选择,不能写成自动测得的画面准确率。
相比只检索真实片段的EditDuet,MemComposer在内容遵循上取得94.5%的偏好,但视觉对齐只有41.8%;真实片段以58.2%占优。生成能补缺失内容,原片在真实性和贴合程度上仍有优势。
图:论文图3上半部分展示面包店请求的多镜头比较,分别列出MemComposer、文字生成规划和真实素材检索结果。
从补拍需求走向可检查的素材流程
面包店案例把店外、店内与小镇镜头串起来,攀岩案例则穿插远景和手脚、绳索特写。静态截图可以展示人物和场景,镜头运动是否自然仍需观看配套视频。
论文还展示了在同一乡村场景中切换目标人物的应用:注入人物参考,再限制检索范围,保持环境信息。它也记录了生成中的检查过程,例如跨镜头道具状态变化,需要重新生成后再确认。
图:论文图4在同一乡村场景中更换目标人物,左边为人物参考,右边是生成的田间劳动镜头序列。
平均时长绝对误差为0.12秒,原因之一是视频生成失败时可以退回静态关键帧,按计划时长填入序列。因此时长控制好,不代表每个镜头都成功生成了自然动作。
复杂物理运动与细粒度姿态连续性仍会失败。当前结果来自有限纪录片项目,后续使用应保留原素材参考、检索记录与返修入口,并将合成补充镜头和实拍内容清楚区分。
参考资料
https://arxiv.org/abs/2610.01884
https://arxiv.org/html/2610.01884