arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

视频生出来,声音分轨也一起有!谷歌等提出SepGen

作者:arXivDaily编辑部 arXiv 2610.11361 cs · cs.CV · cs.SD

论文导读

特拉维夫大学、谷歌联合提出SepGen,生成视频时同时输出分开的声音轨道,也能把已有视频的混合声音拆成两轨。论文以演唱、乐器等例子展示声源对应关系,并通过听音对照评测质量。分轨之后可以分别调整人声和乐器,或重新混音。

歌声和鼓声,生成时就分开

屋顶上的演唱示例有一名歌手和一名鼓手。常见生成视频把两种声音混成一个音轨,后续若只想降低鼓声或突出人声,还得重新分离。SepGen在视频生成时直接预测两个轨道,分别对应两个声源。

另一种模式处理已有视频,把原本混在一起的声音拆开。研究把生成分轨和事后分离放进同一个模型,使它能利用视频画面辅助区分声源,也能使用文字说明指定输出。

示例中的人物画面只能说明声音来源和视频内容,音轨质量还要真正听和测。论文同时提供波形、听音样例和评测,屋顶演唱的静态帧不单独承担“分离干净”的结论。

图:论文生成示例中,一名歌手与一名鼓手在屋顶演出,画面对应两路声音来源。

画面线索,对应到不同音轨

模型沿用已有音视频生成骨干,并让两个音频轨道共享视频信息。它需要同时保持画面与声音的时间关系,还要避免把一个声源复制到两个输出里。

论文的街头乐器图显示,一轨对手鼓区域、另一轨对吉他区域有不同关注。热图来自模型内部对应关系,可用于观察音轨如何联系画面;它不是可直接拿来定位声源的独立测量系统。

训练包括音视频、两个目标轨道及相关说明,并让模型学习不同分离方向。分离已有视频时,可以提供声源的文字描述;说话内容已知时,也可提供台词。不同输入条件在实验里分开列出,不能把有台词的优势当成无提示分离效果。

图:街头手鼓与吉他场景对应两路音轨关注热图,展示不同轨道与画面区域的联系。

听音判断胜出,比例按评审算

生成评测使用194个案例,其中134个为声音效果、60个为语音。事后分离评测包括来自两类生成模型和真实视频的样本。它们有不同来源,分别用于检查生成与分离能力。

人工听音中,生成任务共获得969次判断,SepGen被选择的比例约63%,对照约28%,其余为平局;分离任务共720次判断,分别约58%和25%。这些是听音判断的比例,不能改写成63%的观众或63%的视频都满意。

语音对照还统计识别词错误率。对于Veo语音案例,提供台词时SepGen为0.05,表中最佳对照为0.74;不提供台词时为0.50。提示包含的信息影响很大,低错误率需要连同具体条件一起报告。

应用前景:分轨之后,可以各自处理声音

论文接口图把两种模式并排:文字生成视频与两路声音,或输入已有视频进行分离。分开的音轨可以独立调音量,也可以作为后续剪辑素材;这是分轨输出直接带来的操作空间。

当前研究主要处理两个声源,更多乐器或重叠人声仍需进一步验证。把生成和事后分离放在同一接口中,后续可以检查更复杂场景下每轨的声音质量、串音和视频同步,而不是只检查混音听起来是否自然。

图:左侧由文字生成视频及两路音轨,右侧输入已有视频进行声音分离。

参考资料

https://arxiv.org/abs/2610.11361

https://sepgen.github.io/

↑