arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

vivo、港中大(深圳)等让8B模型规划视频剪辑,得分从0.620升至0.924

作者:arXivDaily编辑部 arXiv 2608.25622 cs · cs.CL · cs.CV

“把开场压到3秒、第二段踩音乐重拍、总时长不超过30秒”不是一句文字建议,而是一组必须能落到时间线的操作。港中大(深圳)、vivo AI Lab、北京大学等机构提出RefineCut,训练8B开源权重模型输出剪辑补丁,再由确定性验证器检查每一步是否可执行。

在包含3578项任务、7971段带说明素材和499首音乐的RefineCut-Bench上,验证器回放蒸馏把协议定义的视频剪辑分数从0.620提高到0.858,学生自我改进阶段继续升至0.924。论文评测的是时间线规划层,不评价最终画面的生成质量。

每个剪辑要求都写进约束账本

任务输入包括剪辑意图、候选片段、音乐信息和硬性约束。系统把它们整理成约束账本,记录必选镜头、顺序、裁剪区间、转场、总时长和节拍对齐。规划器不能只写自然语言,它必须返回结构化RefinePatch,指出时间线的具体修改位置。

论文Figure 3:教师分支先被验证器回放,学生修复再经过验证器与任务评分规则筛选。

验证器应用补丁后重新计算账本,检查补丁能否解析、素材引用是否合法、目标约束是否修复,以及原先满足的要求是否被破坏。因为检查结果可以重复执行,训练监督不依赖另一个模型的主观评分。

三个教师给出的分支先回放再学习

团队让多个前沿API教师为训练任务提出修复分支。视频剪辑没有唯一答案,教师的首选分支可能不可执行,也可能修好时长却破坏镜头顺序。RefineCut不直接模仿首选答案,而是统一格式后逐个回放,让验证器挑出得分最高的分支。

论文训练进程图:原始模型、验证器回放蒸馏与RefineCut-Evo阶段的得分逐步变化。

第一阶段用验证通过的补丁做监督微调,并构造偏好对。第二阶段RefineCut-Evo让学生一次生成4个候选修复,结合确定性检查和固定任务规则挑出高差距样本,再做偏好优化。推理时最多运行3轮“应用—验证”,不再调用教师。

8B模型追平教师依赖同一闭环协议

最终0.924分来自论文定义的Video-Editing Score,它综合执行门槛与规划质量。提升同样出现在Llama-3.1-8B和GLM-4-9B主干上,说明验证器回放不是某一个基础模型的偶然结果。在同一封闭循环中,8B规划器达到或超过教师策略。

论文基准总览:任务由素材池、音乐、编辑意图和显式约束账本组成。

这个比较不能外推成8B模型的视频理解全面超过前沿模型。素材说明、账本和执行接口都由基准提供,规划器主要解决结构化决策;上游若把镜头内容识别错,验证器只能确认补丁合法,无法保证叙事判断正确。

下一步:接入真实剪辑软件并处理感知错误

失败分布显示,闭环仍会遇到素材接地、语义选择、节奏和局部修复问题。验证器擅长硬约束,却不能完全替代“这一镜头是否合适”的审美判断。

论文失败构成图:不同规划阶段的错误被拆成可执行性、约束修复与语义规划等类别。

下一步需要把真实剪辑软件的预览画面、素材变化和人工修改重新送入规划器,并测试更长时间线。代码和基准已经公开,适合复核结构化补丁与验证协议;距离自动完成商业成片,还隔着素材理解、画面质量和编辑偏好三层评估。

实际工作流还会出现素材临时下线、音乐替换和用户手动移动片段。规划器需要读取最新时间线,而不是继续对旧状态打补丁;验证器则要识别版本冲突,拒绝覆盖人工修改。论文的显式账本为这种并发检查提供了基础,但尚未报告多人协作项目或小时级时间线上的结果。

真实部署还应把每次补丁、验证结果和人工接受情况留在审计日志中,方便定位错误来自规划器、素材说明还是执行接口。

参考资料

https://arxiv.org/abs/2608.25622

https://arxiv.org/html/2608.25622

https://github.com/Lancelot-wy/RefineCut

https://huggingface.co/datasets/Randallhy/RefineCut-Bench