arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

数字人一口气说满1分钟!Omni-LiveAvatar单卡跑到21.99 FPS,提速33倍

arXiv 2608.13602 cs.CV · cs.MM · cs.SD

香港科技大学iComAI Lab与Vivix Group团队提出Omni-LiveAvatar,把联合音视频扩散模型改造成少步自回归生成器,在单张NVIDIA H200上完成分钟级流式生成,速度达到21.99 FPS,相比LTX-2快33倍。让数字人连续说上一分钟,画面、口型和声音还能同步实时出现,难点远不只是把一段5秒视频循环播放。

现有音频驱动头像通常先拿到完整语音,再离线生成一段视频;联合音视频模型虽然能同时建模声音和画面,却常依赖双向注意力与多步去噪,既看未来帧,也需要反复计算。短片效果不错,一旦进入长对话,延迟、显存和身份漂移会一起放大。Omni-LiveAvatar的目标,是把生成方式改成真正可以持续接收输入、持续吐出音画的在线过程。

从双向扩散模型蒸馏出少步自回归生成器

团队没有从零训练一个小模型,而是先利用大型双向联合音视频扩散模型的能力,再通过渐进式自回归蒸馏,将多步去噪逐步压缩成少步生成。每一段新内容只依赖已经生成的上下文,不需要反复查看整条未来序列,也不额外引入复杂稳定模块。

Omni-LiveAvatar与现有方法在一分钟流式生成上的效果对比

Omni-LiveAvatar与现有方法在一分钟流式生成上的效果对比。

这种训练思路保住了教师模型对人物外观、语音和动作的联合建模能力,同时把推理结构改造成适合流式部署的形态。论文在5秒设置下测得19.57 FPS,进入一分钟长序列后反而达到21.99 FPS,说明固定上下文预算让长视频没有随着时长线性变慢。速度数据来自单张H200和论文指定配置,消费级显卡上的实际表现仍取决于显存与实现优化。

长短期记忆同时管住口型与人物一致性

流式生成容易顾此失彼:只看最近几帧,嘴部运动自然,但人物身份、服装和背景会慢慢漂移;保存全部历史,又会让计算和显存不断增长。Omni-LiveAvatar设计同步音视频长短期记忆,短期窗口保留连续动作与局部发音,压缩后的长期状态负责维持人物和场景的一致性。

长短期记忆与滚动提示共同维持音视频同步

长短期记忆与滚动提示共同维持音视频同步。

“同步”是这里的关键。模型不是分别生成一条音频和一条视频再强行对齐,而是在同一记忆中更新两种模态,使嘴型、表情和声音节奏共享时间上下文。论文的分钟级样例中,人物可以持续讲话并保持面部特征,避免短片拼接常见的音色突变与画面跳变。

提示词可以滚动更新,长对话不再被一条描述锁死

一分钟视频不应只有一种情绪和动作。团队加入分层滚动提示规划:高层提示控制一段时间内的语义方向,局部提示随着流式窗口推进,并在交界处平滑过渡。数字人可以从平静讲述转为强调观点,或切换动作和表达,而无需重启整段生成。

Omni-LiveAvatar在不同提示和长时长设置下的质量实验

Omni-LiveAvatar在不同提示和长时长设置下的质量实验。

这也让系统更接近实时互动。上游对话模型刚生成新的回答或导演指令,视频端即可接续当前状态,而不是等完整脚本确定后再离线制作。对于虚拟主播、游戏角色和在线客服,响应时间与连续性往往比单帧达到影视级精度更重要。

分层规划还把内容控制分成不同时间尺度:较长的语义段落负责话题连贯,较短窗口负责当前表情与发音。制作方因此可以只修改后续提示,不必破坏已经播出的画面;对无法撤回历史帧的直播场景,这种因果控制尤其关键。

分钟级补充实验展示人物身份与发音动作的连续变化

分钟级补充实验展示人物身份与发音动作的连续变化。

下一步走向真正可交互的数字人直播

Omni-LiveAvatar已经把“分钟级、音画联合、实时流式”放到同一套框架里。下一步可以接入语音识别、对话模型和实时情绪控制,形成从听见用户、组织回答到生成表演的完整闭环;长期记忆也可继续承载角色设定、直播场景和跨轮对话状态。

更接近产品的验证会关注并发成本、不同语言和音色、复杂头部运动以及更长时间的稳定性。若能在更普及的GPU上保持低延迟,并开放精细的动作控制接口,这套技术就可能从论文演示延伸到持续在线的虚拟主播、互动教学和游戏NPC。

参考资料

https://arxiv.org/abs/2608.13602

https://github.com/Aoko955/Omni-LiveAvatar