arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

PAPERDAILY REPORTS

没拍到的镜头也能补:Adobe让AI照着你的素材生成视频

作者:arXivDaily编辑部 arXiv 2610.01884 cs · cs.CV

论文导读

Adobe研究院、捷克理工大学等机构提出MemComposer,让AI记住拍摄素材,再按文字要求生成补充镜头。对比无素材参考方案,用户更偏好它与原片的视觉对齐。系统先规划镜头、检索人物和场景,再生成原片没有的画面,沿用影片的视觉信息。

补镜头之前,先认清原片里的人和地方

MemComposer处理的是补充镜头序列:用户给出自己的视频素材、想要的内容和时长,系统生成能与主片搭配的多镜头画面。项目展示了从十余小时素材中组织参考信息的流程。

单靠文字生成,可能出现一个合理却完全陌生的人物或场所。直接搜索旧素材又受到拍摄范围限制:用户要求某个动作或视角,当时没有拍,就找不到真正满足要求的镜头。

系统先离线构建素材记忆,把人物、场景、物体与风格分开记录,保留适合生成使用的参考帧。人物参考还区分较稳定的外观和临时状态,避免把某一帧里的动作误当成永久身份特征。

图:项目方法图将素材记忆构建、镜头计划与参考检索、关键帧生成和检查串成三个阶段。

每个镜头都带着参考进生成器

收到请求后,系统把内容拆成镜头计划,安排景别、相机运动和时长,再为每一镜检索人物与环境参考。检索不仅比较描述是否相似,还检查参考里的人物身份是否符合该镜头要求。

生成从关键帧开始,后续镜头结合已有内容保持连续。局部检查器核对人物与场景,整段检查器再看重复镜头、跨镜头身份漂移和节奏问题,需要时重新生成指定部分。

通过检查后,关键帧被动画化并拼接。静止或推近镜头采用首帧驱动;环绕或跟拍会露出画面外区域,则加入额外参考。实验用Gemini完成记忆、规划和视觉检查,视频生成使用Veo 3.1。

用户偏好来自39条剪辑请求

实验取五个纪录片项目,抽取39条用户请求,平均目标时长19.1秒。286名参与者分别比较两件事:内容是否遵循文字要求,以及是否贴近原素材的视觉世界,每对视频平均约有五次独立评价。

相比没有素材参考的文字生成规划方案,MemComposer在内容遵循比较中获得60.0%偏好,在视觉对齐比较中为92.8%。这两个比例描述的是用户二选一选择,不能写成自动测得的画面准确率。

相比只检索真实片段的EditDuet,MemComposer在内容遵循上取得94.5%的偏好,但视觉对齐只有41.8%;真实片段以58.2%占优。生成能补缺失内容,原片在真实性和贴合程度上仍有优势。

图:论文图3上半部分展示面包店请求的多镜头比较,分别列出MemComposer、文字生成规划和真实素材检索结果。

从补拍需求走向可检查的素材流程

面包店案例把店外、店内与小镇镜头串起来,攀岩案例则穿插远景和手脚、绳索特写。静态截图可以展示人物和场景,镜头运动是否自然仍需观看配套视频。

论文还展示了在同一乡村场景中切换目标人物的应用:注入人物参考,再限制检索范围,保持环境信息。它也记录了生成中的检查过程,例如跨镜头道具状态变化,需要重新生成后再确认。

图:论文图4在同一乡村场景中更换目标人物,左边为人物参考,右边是生成的田间劳动镜头序列。

平均时长绝对误差为0.12秒,原因之一是视频生成失败时可以退回静态关键帧,按计划时长填入序列。因此时长控制好,不代表每个镜头都成功生成了自然动作。

复杂物理运动与细粒度姿态连续性仍会失败。当前结果来自有限纪录片项目,后续使用应保留原素材参考、检索记录与返修入口,并将合成补充镜头和实拍内容清楚区分。

参考资料

https://arxiv.org/abs/2610.01884

https://arxiv.org/html/2610.01884

https://arxiv.org/pdf/2610.01884

https://cusuh.github.io/MemComposer

↑