arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

阿里通义港中文提出UniSwap:一张脸加一段声音,实时替换说话视频中的人物

arXiv 2608.11752 cs.CV · cs.SD

输入一段说话视频、一张参考人物照片和一小段参考声音,UniSwap会把画面中的外貌和说话音色一起替换,同时保留原视频的动作、场景、台词内容与音画节奏。香港中文大学和阿里通义应用业务团队把过去分开的换脸与变声装进同一个音视频扩散Transformer,并将每个视频块的采样从30步降到3步。

现有方案常先处理画面,再用另一套语音模型改变音色。两条流水线分别优化,嘴部动作、发音时点和声音身份容易出现不一致。长视频还要反复切片,人物外观和声纹可能在块与块之间漂移。

一个模型同时接收源视频、参考脸和参考声音

UniSwap把视觉与音频放入统一扩散骨干。源视频提供姿态、表情、场景和时间节奏,参考图指定目标外貌,参考声音提供音色。模型只替换身份相关特征,语言内容和原始动作继续由源视频约束。

UniSwap把源视频、参考图和声音合成同一人物

UniSwap把源视频、参考图和声音合成同一人物。

统一建模让嘴型和声音在相同时间轴上生成。系统不用在最后一步再把独立音轨硬贴到换脸视频上,也减少了一个模块出错后向另一模块传递错误的情况。论文把它称为首个流式联合音视频身份替换框架。

没有成对换身份数据,就先抹掉身份再重建

训练这类模型需要同一段内容由不同人物以相同动作和节奏表演,但现实中几乎找不到严格对齐的跨身份素材。团队提出swap-and-reconstruct流程:先从真实视频中去除视觉与声音身份,再要求模型利用参考条件重建原片。原视频本身就能充当目标,不必额外拍摄一对一复刻表演。

UniSwap从预训练到流式适配和少步蒸馏的三阶段流程

UniSwap从预训练到流式适配和少步蒸馏的三阶段流程。

训练分三步推进。上下文预训练先学会联合替换;条件流式适配把双向骨干改成块级因果生成并复用KV缓存;Self-Forcing DMD处理模型在长序列中接触自身输出时的偏差,同时把采样预算从30步压缩为3步。

三阶段各自解决一个独立问题:先让模型知道视觉身份和声音身份应该一起变化,再让它适应只能看到历史的视频流,最后压缩采样以满足在线速度。直接从少步流式目标开始训练,会同时面对数据不足、因果建模和误差累积,优化更难稳定。

Multi-LoRA让三种蒸馏角色共用冻结骨干

DMD训练涉及不同角色,如果分别保存完整模型,22B级骨干会带来很高显存和训练成本。UniSwap使用Efficient Multi-LoRA Switching,让三个角色共享一套冻结主干,仅切换轻量LoRA参数。Feature-RoPE Decomposition则把缓存位置维持在训练范围内,避免长视频的位置编号不断外推。

UniSwap与其他方法在短视频身份替换上的对比

UniSwap与其他方法在短视频身份替换上的对比。

论文实验报告了较强的音画同步、身份保持、流式效率和长时稳定性。这里的“实时”依赖论文硬件与实现,摘要没有给出面向消费级设备的统一速度;身份相似度也不代表所有角度、遮挡和说话语言都能保持同等效果。

长视频中不同时间点的视听身份一致性

长视频中不同时间点的视听身份一致性。

从影视配音走向有授权的实时虚拟角色

联合替换可用于有授权的影视角色本地化、虚拟主播和远程表演:台词与动作沿用原片,角色外观和声音作为一组身份资产切换。流式接口还允许系统在内容不断到达时处理,不必等整段视频完成。

这类能力同时要求更严格的身份授权、内容标识和滥用防护。论文证明的是统一模型可以协调两种模态,并非绕过素材权利的工具。产品化阶段若加入水印、授权验证和可追溯记录,才能让实时替换进入正规的制作链路。

正规制作还需要控制“替换哪些内容”。影视本地化通常希望保留原演员动作与场景,只改变授权角色的脸和音色;虚拟主播则可能允许更大幅度的风格调整。UniSwap把身份条件集中到一个模型,为权限系统按视觉、声音或联合身份分别授权提供了技术接口。

参考资料

https://arxiv.org/abs/2608.11752

https://uniswap-av.github.io/