arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

快手等让长视频智能体从制作记录里自我改进,复审调用降37%

作者:arXivDaily编辑部 arXiv 2608.29621 cs · cs.AI · cs.CV

同济大学、快手科技和复旦大学提出CineForge,让长视频制作智能体从一次次完整制作记录中提炼可复用策略。经过跨故事演化后,CineScope-Metric由4.024提高到4.380,在新故事上的复审大模型调用减少37.0%。

生成长故事不是把多个短片直接拼接。智能体要拆剧情、维护人物和空间状态、设计镜头、准备资产、写提示、渲染并返工,前一幕的小错误可能在数个镜头后变成角色外观或因果关系断裂。CineForge把这些过程保存为可检查的生产轨迹。

每个故事先变成有类型的制作状态

CineForge-Produce负责实际生产。它把原始故事拆成叙事、角色、空间和电影化状态,再协调资产与片段生成。状态不是简单的聊天记录,而是明确记录谁在何处、发生了什么、镜头如何连接,以及哪些素材被后续镜头复用。

系统还把计划、生成、评价、错误和修改写入统一轨迹。这样复盘时能够定位问题发生在哪个阶段:是剧本分解漏掉因果,角色资产准备不一致,还是镜头提示没有继承空间状态。只有定位到阶段,经验才可能转成下一次可执行的改动。

图:论文Figure 1对比单次提示重写、通用技能精修与CineForge的阶段策略演化。

从案例到模式,再变成局部策略补丁

CineForge-Evolve使用CPPE流程,先从轨迹证据中提取案例,再把跨故事反复出现的问题合并成模式,最后形成边界明确的阶段局部补丁。它不会因为一个失败案例就改写整套生产规则,也不会把某个故事的角色细节错误地当成通用经验。

新策略上线前要经过结构回放和成对评估,并用置信度控制是否部署。这个门槛用于避免自我改进变成自我污染:只有当补丁能修复目标问题,又不破坏其他阶段时,才进入持续使用的策略集合。

图:论文Figure 2展示CineForge-Produce记录轨迹,以及CineForge-Evolve生成策略补丁。

100个脚本同时检查因果与导演调度

团队构建CineScope,包括100个脚本和多尺度评价指标。它不只看单帧画质,还覆盖因果状态、导演调度、节奏与资源分配、角色弧线,要求系统完成整个故事。演化后的策略把CineScope-Metric从4.024提升到4.380,并在两个公开基准上取得一致改善。

随着演化轮次增加,系统在新故事上需要调用复审大模型的次数下降37.0%,说明部分重复错误已经被压缩为前置策略,不必每次依赖昂贵复查。结果来自论文的100个脚本和相关基准,尚不能外推为所有题材都能稳定生成完整长片。

图:论文结果页面区域,展示演化轮次增加后质量指标上升、复审调用下降。

制作轨迹走向视频智能体的长期资产

CineForge把生产过程从一次性日志变成可积累经验,为广告、短剧和教育视频的批量制作提供了可审计思路。团队可以检查某条策略来自哪些失败案例,也能在题材变化时只撤回局部补丁,而不是重新训练全部模型。

下一步应在更长故事、不同视频生成底模和真人制作团队中检验。尤其要区分评价模型偏好与真实叙事质量,并记录策略在跨文化、跨类型脚本上的迁移。只有长期收益稳定超过复盘与验证成本,自演化生产线才具有实际部署价值。

策略库还需要处理冲突与过期。一条为写实短剧总结的镜头规则,可能损害动画或实验视频的表达;底层生成模型升级后,旧补丁也可能不再适用。为每条策略保存题材、模型版本、证据轨迹和适用阶段,才能在新项目中做条件化选择,而不是无差别叠加。

真人团队的修改记录可以成为另一种验证来源。若导演经常撤销某类自动补丁,系统应降低其置信度;若同一问题跨项目反复被人工修正,则可进入候选策略。这样的反馈闭环比单靠复审模型更接近真实制作流程,也能检查37%的调用下降是否伴随人工工作量增加。

参考资料

https://arxiv.org/abs/2608.29621