arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

一段旧视频也能换机位重拍,Manifold4D把平移误差最多降32%

作者:arXivDaily编辑部 arXiv 2608.28174 cs · cs.CV

拍好的一段单目视频,输入一条新的六自由度相机轨迹,模型就沿新机位重新生成画面。浙江大学、Manifold Tech、上海科技大学、剑桥大学等机构提出Manifold4D,处理视频换机位重拍时最容易出现的几何漂移和相机控制误差。

论文报告,在两套评测中,Manifold4D相对比较方法把旋转误差降低25%和27%,平移误差最高降低32%。结果来自给定视频与目标轨迹的研究基准;复杂遮挡、原镜头看不到的区域和大幅越界运镜,仍会限制重拍质量。

新视角生成最怕相机轨迹失真

普通视频生成模型擅长补画面,却未必严格服从目标相机。相机向左平移时,模型可能只让前景物体略微移动;要求绕主体旋转时,背景结构也可能跟着变形。画面单帧看着合理,连续播放后却不像同一个三维场景被另一台相机拍到。

视频换机位需要同时守住三件事:原视频中的人物和物体身份、目标相机的运动、帧与帧之间的几何一致性。仅靠二维像素条件难以区分“物体在动”和“相机在动”,Manifold4D因此引入显式三维中间表示。

图1:模型输入单目视频和目标相机轨迹,输出沿新机位生成的连续画面。

先把视频变成带相机的点云流形

方法先估计每帧深度与相机位姿,将原视频反投影为时变点云。目标相机沿新轨迹渲染这些点云,得到不完整但几何位置明确的条件画面。原镜头没看到的区域会留下空洞,动态物体和深度误差也会产生噪声,所以渲染结果不能直接作为成片。

扩散模型负责去噪和补全。训练时,团队在点云渲染形成的流形附近加入扰动,让模型学会从有缺口、有错位的几何条件恢复一致视频;起始帧与条件布局约束主体身份,目标轨迹则提供相机控制。

图2:原视频被提升到点云并按目标相机渲染,再由视频扩散模型去噪补全。

旋转和平移误差分别量化

团队没有只用画质分数评价“看起来像不像”,还从生成视频恢复相机轨迹,与输入目标轨迹比较旋转和平移误差。在DAVIS-Traj和Vista4D-Eval上,Manifold4D的旋转误差相对基线分别降低约25%和27%,平移误差的最高降幅约32%。

图3:目标偏航角逐步增大时,各方法的相机控制误差变化。

偏航幅度加大后,所有方法都更难控制。Manifold4D在已测范围内保持较低轨迹误差,但超出原视频可见区域越多,模型需要生成的新内容越多,几何条件提供的真实信息也越少。此时画面质量与轨迹服从度会同时下降。

下一步:从短视频重拍走向可控制作

项目演示展示人物、汽车、动物和室内外场景的重拍。与只依靠生成先验的方法相比,Manifold4D在新机位下更能维持主体位置与背景结构;与过度依赖点云渲染的方法相比,它又能补掉空洞,减少边缘破碎。

图4:目标偏航幅度增大时,视频画质指标随几何外推难度上升而变化。

下一步可把目标轨迹编辑接入视频剪辑工具,让创作者在三维视图里画运镜,再回到时间线检查结果。真正进入制作流程前,还要补齐高分辨率、长镜头、快速人体运动和遮挡恢复测试,并让编辑者能锁定不可改动的主体区域,而不是每次把整段视频交给模型自由补全。

制作端还需要逐帧检查人物身份、物体拓扑和光照连续性。一次平均误差下降并不能保证所有片段都可交付,尤其当新视角露出原视频从未拍到的背面时,模型会补全而非恢复真实内容。项目应同时标记外推幅度、遮挡区域和不确定性,让剪辑人员知道哪些画面需要回退原机位或人工修补。

这些标记也应随导出素材一起进入项目档案,便于复审。

参考资料

https://arxiv.org/abs/2608.28174

https://arxiv.org/html/2608.28174

https://yongxuqixiang.github.io/Manifold4D-Project-Page/

https://arxiv.org/pdf/2608.28174