arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

超越连贯性:多镜头音视频生成中专业剪辑技术执行的基准测试

Beyond Coherence: Benchmarking Professional Editing-Technique Execution in Multi-Shot Audio-Video Generation

Tianyi Zeng, Junchao Liao, Yujie Wei, Ziying Zhang, Litao Li, Tianyi Wang, Zhichao Wei, Shuyao Xu, Wenwen Qiang, Siyu Zhu, Zhenghao Zhang, Long Qin

arXiv 2609.08275首次发表:更新:

发表机构

Shanghai Jiao Tong University; Alibaba Group; Fudan University; UT Austin; Institute of Software, Chinese Academy of Sciences(上海交通大学; 阿里巴巴集团; 复旦大学; 德克萨斯大学奥斯汀分校; 中国科学院软件研究所)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

提出CutCraft基准,评估多镜头音视频生成中专业剪辑技术执行,发现现有模型在连贯性与剪辑执行间存在显著差距。

AI 中文摘要

近期的多镜头音视频生成器能够产生越来越连贯且具有电影感的输出,但连贯性并不等同于执行剪辑技术的能力。专业剪辑依赖于镜头结构、转场语法、音视频剪切关系以及蒙太奇手法,然而现有基准大多依赖内容质量、同步性或物理合理性等代理指标,系统性地忽略了这些剪辑指令是否真正被执行。我们提出了CutCraft,这是首个针对多镜头音视频生成中剪辑技术执行的基准。CutCraft通过明确的剪辑规范扩展了结构化的多镜头提示,并配备了一个分层混合评估框架,该框架结合了镜头结构对齐、专家模型指标、基于工具的跨模态判断以及基于量规的问答。除了评估之外,我们还设计了一个智能体剪辑基线,将生成过程分解为规划、镜头级合成和事后合成,明确实现了J-cut、L-cut和转场时机等剪辑语义。在13个最先进的闭源和开源模型中,CutCraft揭示了连贯性与剪辑技术执行之间的一致差距:当前系统通常能生成看似合理的多镜头视频,却无法可靠地执行剪辑指令。我们发现了不稳定的镜头结构、对转场执行的控制薄弱,以及在更高阶蒙太奇上的显著性能下降,而美学质量与剪辑技术合规性仅存在弱相关。该基准、评估指标以及剪辑智能体基线可在以下网址获取:此https网址。

英文摘要

Recent multi-shot audio-video generators can produce increasingly coherent and cinematic outputs, but coherence does not imply the ability to execute editing techniques. Professional editing depends on shot structure, transition grammar, audio-video cut relations, and montage, yet existing benchmarks largely rely on proxies such as content quality, synchronization, or physical plausibility, systematically missing whether such editing instructions are actually executed. We introduce CutCraft, the first benchmark for editing-technique execution in multi-shot audio-video generation. CutCraft extends structured multi-shot prompts with explicit editing specifications and is paired with a hierarchical hybrid evaluation framework that combines shot-structure alignment, expert-model metrics, tool-grounded multimodal judgment, and rubric-based question answering. Beyond evaluation, we design an agentic editing baseline that decomposes generation into planning, shot-level synthesis, and post-hoc composition, explicitly realizing editing semantics such as J-cuts, L-cuts, and transition timing. Across 13 state-of-the-art closed- and open-source models, CutCraft reveals a consistent gap between coherence and editing-technique execution: current systems often produce plausible multi-shot videos yet fail to execute editorial instructions reliably. We find unstable shot structures, weak control of transition execution, and sharp degradation on higher-order montage, while aesthetic quality is only weakly correlated with editing-technique compliance. The benchmark and metrics, and the editing agent baseline are available at https://github.com/AlibabaResearch/cut-craft-bench.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑