论文导读
上海人工智能实验室联合香港理工大学、新加坡国立大学、浙江大学提出AV-GRPO,用强化学习同时调教视频的画面和声音。在JavisBench与VABench上,它在生成质量、语义对齐和跨模态同步上全面超过LTX-2.3。AI生成的视频终于不再像在演默片。
画面很美,但声音老是对不上
联合音视频生成近年进步很快,模型已经能一次产出画面加配音。但三个问题一直没解决好:单看画面或单听声音,各自的保真度不够;画面声音与文本提示对不齐;最致命的是跨模态同步——关门声落在动作之后、说话口型与配音错位,一眼就出戏。
用强化学习做后训练本是条好路子,可简单照搬单模态做法会遇到麻烦。画面塔和声音塔的奖励信号纠缠在一起,谁该为结果负责说不清;两塔同时优化又非常吃算力。
把“一起卷”拆成“各自卷、对齐看”
AV-GRPO的核心思路,是把耦合的多模态偏好学习拆成一组带条件的单模态子问题。它包含三个关键设计。
第一是模态锚定采样:优化一个模态时,把另一个模态固定下来作为“锚”,这样既解耦了学习信号,又避免因为配对样本不同导致同步评分时难时易、比较不公平。第二是轨迹锁定的冻结塔优化:训练一个塔时另一个塔冻结,大幅降低算力,也让功劳归属更清晰。第三是针对每个模态自身特点和样本难度,自适应调整训练目标和扰动强度。
图:框架图展示画面塔与声音塔如何以一方为锚分别优化、再共同对齐。
为支撑系统化训练,团队还构建了5DAV数据集,沿五个维度完全解耦、难度可控,可以分别训练和排查不同模态、不同难度的问题。
两大基准全面超过LTX-2.3
实验在JavisBench和VABench两个基准上展开,对比对象是联合音视频生成的强基线LTX-2.3。无论LoRA轻量微调还是全参数微调,AV-GRPO在生成质量、语义对齐和跨模态同步三项上都稳定占优。下表是JavisBench主结果,各指标同步提升。
图:主结果表逐行列出AV-GRPO与LTX-2.3在多项指标上的数值,前者全面领先。
除了表格里的分数,直观样例更能说明问题。下图对比了不同方法在同一段提示下的生成结果,AV-GRPO的口型、动作与音效对应得更准,其他方法在关键发声时刻仍有错位。
图:三组对比样例中,AV-GRPO的音效时刻与画面动作贴合得更加紧密。
未来落地:一次生成,少跑一趟音效工作室
对视频创作者来说,这类能力的直接价值是缩短后期链路:配音和音效不再需要单独生成、手动对齐,一次推理就能拿到声画同步的成片素材。团队已公开代码与数据,降低了复现和二次开发的门槛。
下一步的方向包括更长时长下的声画一致性、多人多声源场景的同步,以及把强化学习训练成本进一步压低。随着音画同步从短板变成长板,AI视频在短剧、广告和教学内容里的可用性会继续提升。