蚂蚁集团、香港中文大学、清华大学等机构的研究团队提出了CameraAnything,第一个同时控制相机内参和外参的视频编辑统一框架。给定一段源视频,它可以按指定的机位轨迹、焦距和画幅重新「拍摄」这段内容,不需要裁切或外绘补全。用户研究里,CameraAnything在相机对齐维度获得73.3%的偏好率,明显超过对比方法ReCamMaster。
相机控制的两个半成品
视频生成模型已经能做出好看的运动画面,但控制相机仍然是件别扭的事。已有方法要么依赖昂贵的三维重建来获得完整的相机功能,要么只支持外参操作——挪动机位可以,改变焦距不行。麻烦的根源在于内参和外参耦合:焦距一变,画面透视和内容外观一起变,把两者拆开建模很难。
CameraAnything的解法是在目标隐层上同时建立相机条件和空间位置编码。每个像素注入Plücker射线,配合分辨率感知的三维RoPE注意力,让位置、焦距和原生分辨率编辑在同一个自注意力里联合控制。简单说,模型直接「知道」每个像素对应空间中的哪条光线,相机参数成了可编辑的条件而不是隐含变量。
训练数据是另一个障碍:同一段内容很难拍到两个不同相机参数的版本。团队为此搭建了可扩展的合成管线来生成成对数据。
三条正交的控制轴
论文把视频到视频的重拍任务拆成三个正交维度:外参(运镜与剪切)、焦距、画幅。三者可以独立指定,也可以组合。比如保持机位不动只变焦,或者固定焦距改画幅从横屏改成竖屏,原生分辨率编辑不需要裁切和外绘。
这套设计落在常见的视频扩散Transformer骨架上,相机条件通过Plücker射线注入目标隐层,与3D RoPE的位置编码在自注意力层融合。推理时给定源视频和目标相机参数序列,模型输出重拍后的视频。
图:CameraAnything的框架总览。源视频与目标相机条件经Plücker射线注入和3D RoPE,在去噪网络中联合控制重拍结果(论文Figure 3)。
指标上压过专用方法
在合成数据基准上,CameraAnything的重建质量超过TrajectoryCrafter和ReCamMaster:PSNR达到15.88,对比两者分别为12.24和12.87。真实场景的相机误差同样更低,旋转误差2.76度,优于两个对比方法。这意味着模型输出的相机运动确实落在了指定的轨迹上,不是「大概像」。
用户研究补充了主观维度。在相机对齐、外观保真和整体质量三项比较中,CameraAnything全面被偏好,其中相机对齐一项拿到73.3%的偏好率,对ReCamMaster优势最大。相机对齐正是这个方法的核心卖点:镜头语言是否忠实执行。
图:与TrajectoryCrafter、ReCamMaster的定性对比。给定输入相机与目标重拍参数,CameraAnything的轨迹与画面内容更忠实(论文Figure 5)。
从电影感重拍到长镜头
演示覆盖了几类典型场景:把滑雪 footage 换一条运动轨迹重拍,把固定机位的雪林散步改成环绕运镜,保持人物动作和背景不变。焦距控制可以在不裁切画面的前提下从广角推到长焦,画幅控制则在横竖屏之间直接转换。
图:输入相机与目标重拍条件下的影片级结果。源视频经CameraAnything重新运镜后,人物动作与场景保持一致(论文Figure 9)。
图:teaser示例。同一源视频在不同相机参数下得到多版重拍结果,镜头语言完全由参数决定(论文Figure 1)。
从素材复用走向后期重拍
对影视和短视频行业,CameraAnything指向的是后期阶段的重新运镜:素材拍完之后仍然可以改焦距、改轨迹、改画幅,代价是一次前向推理。这让「先拍下来,运镜后期再定」的工作流成为可能,对素材复用和小团队制片都有直接价值。
局限也要说清楚:模型在训练分布外的极端相机运动上表现如何,论文没有给出系统性评估;长视频的时序一致性仍有挑战。团队把方法定位为视频编辑框架而非拍摄替代,下一步的自然方向是更高分辨率、更长时长,以及与现有剪辑工具的结合。