arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

老电影不再分开修画面和声音:22B模型一次处理噪点、闪烁与嘶声

arXiv 2608.04224 cs.CV

中国科学技术大学和京东探索研究院提出OmniVR,用一个22B参数音视频生成模型同时修复历史影片。输入里的模糊、噪点、闪烁、低曝光、嘶声、削波和声音缺失,会在统一扩散过程中处理,而不是先修画面、再接独立音频工具。

团队还建立OmniVRBench,收录200段真实历史影片:129段没有干净参考,71段受控退化片段保留参考。OmniVR在论文报告的六项无参考视觉指标上全部优于对比方法,并取得最佳音频质量结果。

OmniVR联合修复历史影片音画

论文图1:模型把低质量视频与音频作为条件,在同一生成骨干中恢复画面细节、颜色和声谱。

分开修复容易把两条时间线拆散

传统方案可以用视频超分辨率锐化画面,用音频修复器减少嘶声,但两套模型各自优化,无法利用嘴部动作与语音、镜头节奏与声学事件之间的对应关系。单独上色还可能在帧间改变色调,单独去噪也不会检查口型同步。

历史影片中音频与视频退化的共现

论文图2:真实片段中视觉和声学缺陷经常同时出现,单模态质量还可能严重失衡。

OmniVR基于LTX-2的联合音视频生成骨干,把低质量音画编码成条件,再共同去噪目标潜变量。首帧图像作为长视频锚点,波形监督约束音频细节,损失重加权则避免某一种退化压过另一种。

没有足够成对老电影,就先合成损坏过程

真实档案很少同时保存“受损版”和“干净原版”。团队从互联网收集较干净视频,随机加入模糊、噪声、闪烁、压缩、灰度化以及多种音频缺陷,合成训练对;模型由文字生成音视频逐步转成“低质量音画到修复音画”。

OmniVR联合音视频修复架构

论文图3:视频与音频先分别编码,再作为联合条件进入多模态扩散Transformer。

受控轨道只有说话人片段,因为口型同步指标需要清晰、连续的嘴部区域。真实轨道更广,包括人物、风景、群众和新闻纪录片,但没有干净参考,只能依靠无参考质量指标与人工偏好评价。

训练中合成的音画退化样本

论文图4:联合退化管线同时制造画面模糊、噪声、灰度变化和声学缺陷。

修得更“好看”不等于还原历史原貌

没有干净参考时,生成模型可能补出原片不存在的纹理和颜色。无参考指标偏好更锐利、更干净的画面,也无法单独证明历史真实性。极端缺帧、重剪切仍会造成时间漂移,固定窗口推理也难保留长距离叙事关系。

因此,OmniVR更适合被理解为一套联合生成式修复方法和评测起点。用于档案保存时,仍需保留原始素材、标注生成改动,并由修复人员检查模型补出的内容。

参考资料

https://arxiv.org/abs/2608.04224

https://xin1u.github.io/OminiVR_PAGE/