字节跳动、AMD和香港理工大学等团队提出Avatar-Forever,让22B视频基础模型在单张H100上以27.2 FPS生成768×512音频驱动数字人。架构采用流式输出,不设固定总时长,并针对自回归视频常见的“越播越糊、人物越播越不像”单独训练恢复能力。
数字人实时生成通常依靠少步蒸馏,把几十次去噪压缩为少数几步。速度上来后,前一个视频块中的小误差会作为下一块的输入不断累积。短片看起来正常,直播拉长后就可能出现脸部变形、纹理闪烁和动作失真。
把“生成得快”和“播得久”分开训练
以往流水线先完成少步蒸馏,再基于蒸馏模型适配长视频。后一阶段继承前一阶段的分布偏差,两种目标也会互相拉扯:追求少步生成偏向短期画质,修复长程误差则要让模型看到已经污染的历史。任何一环变化,都可能迫使后面的训练重新调整。
Avatar-Forever在接近12分钟序列中的人物状态。
Avatar-Forever把两项能力拆成并行分支。一条分支做全参数蒸馏,负责高质量快速生成;另一条只训练轻量长程适配器,通过Recovery-oriented Rollout Training学习在长序列中发现并拉回偏离。两条线完成后再组合,避免长时适配直接破坏生成器已经学到的局部细节。
RRT专门拿模型自己的坏历史来练恢复
恢复导向滚动训练不会只给模型干净的真实历史帧。它让系统在长时间推理条件下滚动,接触由自己造成的颜色、身份和结构偏差,再学习怎样回到参考人物。训练目标对准实际部署时出现的误差分布,而非短片数据中的理想输入。
Avatar-Forever并行训练生成器与长程适配器的流程。
团队还设计ForeverCache,以视频块为单位缓存可复用特征。流式生成每次只处理新到达的音频和必要历史,不反复计算整段序列。缓存把推理成本控制在稳定范围内,也是“无限”流式架构能够落地的工程前提。
解耦训练也降低了排查难度。短片出现嘴型或纹理问题时,可以集中检查蒸馏生成器;只有长时间滚动后才出现身份漂移,则优先调整RRT适配器。两个目标不再绑在同一次顺序优化中,基础模型升级时也可以分别验证速度与长程稳定。
单张H100输出27.2 FPS的高分辨率数字人
论文报告,22B模型在一张H100上生成768×512视频可达27.2 FPS,跨过常见视频播放的实时门槛。生成由音频驱动,系统需要同时保持口型、头部动作、人物身份和整体画质。长时间示例按多个时间点展示同一人物,重点检验误差是否沿时间轴扩大。
Avatar-Forever长序列中的身份与画面一致性。
这里的“无限”指模型和缓存不要求预先设定总长度,计算量也不会随完整历史线性增长,并不表示模型在任何音频、人物和时长下永远不会出错。27.2 FPS同样基于H100,普通直播工作站能否达到相同吞吐仍要看量化、显存和并行策略。
ForeverCache减少流式推理中重复历史计算。
下一步接入数字人直播链路
并行训练为产品迭代留下了更清晰的接口。生成器可以继续优化速度和局部画质,长程适配器则专注恢复能力;直播平台更换基础视频模型后,不必把整套长视频训练按原顺序重做。ForeverCache也适合保持固定延迟的在线服务。
下一步需要覆盖更多说话风格、快速转头、遮挡和背景变化,并在更常见GPU上测量端到端延迟。论文已经证明单卡高端GPU可以把高分辨率数字人推过实时线,后续工程重点将落在成本、鲁棒性和长时间无人值守运行。
直播系统还包含音频采集、驱动特征提取、编码和网络传输,27.2 FPS只描述生成部分的吞吐。若要让观众感到即时响应,整条链路的首帧等待和声音到嘴型的延迟都要单独测量。Avatar-Forever提供了生成核心,平台仍需完成服务调度与异常恢复。
这些指标还应在目标直播分辨率和完整服务链路中重新测量。