论文导读
Adobe Research、伍斯特理工学院提出CamPilot,让多个智能体先规划故事、镜头角度、相机运动和焦点,再按拍摄脚本生成多镜头视频。团队从14,581部视频整理99,975个镜头用于训练和评测;成绩来自自建CamEval与自动指标,尚不能等同于专业剧组成片质量。
文生视频画面变好了,镜头语言仍可能很平
普通文生视频模型直接把提示词变成画面,能生成一只奔跑的狗,却不一定知道先用高机位交代环境、再推近表情、最后跟拍动作。单个镜头看起来合理,多镜头拼在一起仍会缺少节奏,人物位置和视线也可能断开。
CamPilot把生成前的决策写成拍摄脚本。用户先给场景和情绪,故事规划器拆出镜头;相机工作规划器为每个镜头选择角度、运动、焦距和景别;视频模型再执行。修订智能体会检查生成结果与计划是否一致,必要时返回修改。
图1:经典文生视频直接出片,CamPilot先生成按时间排列的运镜计划。
近10万个镜头教模型识别拍摄选择
团队从14,581部视频中提取99,975个镜头,时间覆盖2019至2020年。训练集包含12,641部视频和85,048个镜头,验证集与测试集各1000部。视觉语言模型为片段标注镜头类别、运动方式和构图,再给相机规划器提供监督。
这个数据集名为CamEval,既训练规划能力,也评估镜头分类、关键帧生成和电影生成。它把“运镜好不好”拆成可计算指标,但标注来自模型生成和自动整理,无法完全替代摄影师对叙事、表演和剪辑的判断。
图2:相机规划器、视频生成器、修订器和评估器围绕拍摄脚本协作。
同一骨干下,规划器把相机工作F1推到27.2%
以Llama-3.1-8B-Instruct为骨干,普通提示的相机工作Macro-F1为9.8%,监督微调为13.7%,CamPilot达到27.2%。电影生成部分,主体一致性得分95.0,美学分59.0,高于同表中的MovieAgent和DreamFactory。
图3:季节变化与赛车场景中,两种方法的多镜头结果对比。
表中数字说明规划步骤在CamEval协议里有效。模型仍依赖底层视频生成器,遇到人物一致性、物理运动或长时叙事错误,拍摄脚本不能单独修好。数据主要来自有限年份和通用类型电影,镜头语言也可能受来源分布限制。
下一步要把可控镜头变成可编辑时间线
现在的流程能生成拍摄脚本,但创作者更需要逐镜头修改:锁定某个机位、延长动作、替换转场,并保持其他镜头不变。后续可以把规划器输出接入时间线,让人先批准镜头表,再调用不同视频模型执行。
产品化还需记录每次修订用了多少生成轮次,以及镜头一致性提升是否值得额外成本。CamPilot给出一套可检验的“先规划后生成”流程,真正进入电影制作仍要经过人工导演、剪辑和版权审查。