论文导读
阿里巴巴万相团队联合南京大学、复旦大学、清华大学做出一个397B参数的提示增强模型WanPE。它把用户的简单一句话扩写成导演级分镜计划再驱动视频生成,30秒视频的人类好评率相对原始提示暴涨50.86个点。长视频终于不再靠写提示碰运气。
视频越长,写提示越像在下赌注
今天的视频生成器已经能做30秒、多镜头的复杂内容。但生成的起点仍然是文字:用户写一句话,模型自己决定动作怎么发生、镜头怎么运动、光线怎么变化。5秒短片里,一句话或许够用;镜头一旦拉长,动作衔接、场景转换、叙事节奏全压在那几行字上,普通用户很难一次写到位。
同一句简单提示,喂给生成器和先经过导演级扩写再生成,结果差距非常明显。下图上排是直接用原始提示生成的画面,下排是WanPE扩写后生成的对应画面,镜头语言和场景细节都更完整。
图:上下两排分别对应原始提示与增强提示生成的视频帧,下排场景和镜头信息明显更丰富。
不教模型“怎么写”,而是倒推“导演写过什么”
团队的思路是让模型从真实视频里反向学习。做法是先收集105万个真实视频,让模型从画面反推:如果拍出了这样的视频,当初的分镜剧本应该怎么写。这比传统“拿一句话教它改写”的正向训练更有效,论文消融实验也证实逆向构造明显优于正向改写。
WanPE据此输出镜头级的电影计划,涵盖动作、运镜、光线和声音,再交给底层视频生成器。为防止扩写时跑偏、把用户没要求的内容硬塞进去,团队还设计了语义一致性强化学习方法SC-GRPO,在多个镜头和整段时间上守住用户的原始要求。
图:流程图展示从真实视频反推分镜计划、再经一致性优化驱动视频生成的完整链路。
一万次盲评:短视频全面领先,30秒暴涨50个点
为了严肃评测,团队专门构建了人工标注测试集WanPEval,覆盖5秒到30秒不同时长和不同意图粒度,背后是约1.1万次盲评成对比较——评审不知道哪边用了增强提示,只凭观感选择。
结果在5到15秒时长上,WanPE-397B把人类偏好相对原始提示提升了10.66到18.84个点;进入30秒竞技场,提升幅度达到50.86个点。下图按七类内容统计偏好得分,长视频和叙事类内容的提升尤其突出。横向对比中,WanPE在5到15秒领先全部参评商业系统,30秒则与Seedance 2.5处于同一竞争水平。
图:雷达图沿七个内容类别轴给出偏好得分,各轴上均较原始提示有明显提升。
未来落地:把导演经验变成人人可用的一层
对普通创作者而言,这类模型的价值是把“会写分镜”从专业技能变成生成流程里自动经过的一层:用户只需说清意图,构图、运镜和节奏由提示增强补齐。团队已经把它接入万相视频生成器,项目页面也公开了多组对比样例。
下一步的关键在于更复杂的叙事约束、更长时长下的前后一致性,以及把音效和台词纳入统一规划。随着这一层成熟,视频创作的门槛会从“写出好提示”进一步回到“讲清一个好故事”。