arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

阿里通义联手港中文提出LiveAnimate:14B模型让单图人物实时跳满3分钟

arXiv 2608.11745 cs.CV

给一张人物照片,再持续输入身体姿态和面部动作,14B参数的视频模型可以像直播一样连续输出动画。香港中文大学、阿里通义应用业务和LiblibAI提出LiveAnimate,在两张NVIDIA H100上达到19.63 FPS,并在3分钟测试中把人物身份和画质基本维持到最后一分钟。

扩散模型过去生成一段人物视频往往要等几分钟甚至几小时,适合离线制作,却无法响应直播、远程呈现和互动数字人。LiveAnimate把输入改成持续到来的动作流,每生成一个时间块就立即返回画面,不需要先知道整段表演有多长。

从离线整段生成改成边收动作边出画面

常见视频DiT能够同时查看一段视频的前后帧,因此容易保持局部质量,但也意味着生成前必须拿到完整序列。LiveAnimate先用“参考图锚定的教师强制适配”,把原本双向的视频DiT改造成块级因果生成器:当前块只能使用参考图、历史块和此刻收到的姿态,符合实时系统的数据到达顺序。

LiveAnimate从参考图和姿态流生成长时人物动画

LiveAnimate从参考图和姿态流生成长时人物动画。

第二阶段采用块级Self-Forcing蒸馏,把每个视频块的扩散采样压缩到3步。训练时,模型接触由自身上一块生成的历史,而非一直读取无误差的真实帧,减少训练与长时推理之间的落差。Ulysses序列并行和算子融合进一步压低延迟,最终在两张H100上接近20 FPS。

三组记忆槽,遇到重复姿态就找回旧外观

流式人物动画最容易在长时间运行后出现脸型、衣服纹理和身体比例漂移。完整保留所有历史帧会让显存和延迟随时长增长。LiveAnimate设计PR-Sink注意力,只保留三个层次的上下文:第一块画面作为静态锚点永久存在,一段与当前姿态最相似的历史作为动态锚点,再加一个三槽滚动窗口保存最近动作。

LiveAnimate的两阶段训练与PR-Sink长时记忆结构

LiveAnimate的两阶段训练与PR-Sink长时记忆结构。

当人物再次做出早先出现过的姿态,系统从历史中取回对应块,恢复那一姿态下的衣服褶皱、肢体外观和面部状态。缓存大小固定,因此生成到第10分钟时,每个新块的计算量不会因为前面已经积累大量画面而继续膨胀。

静态锚点与动态锚点承担不同职责。第一块始终提醒模型参考人物最初长什么样,动态锚点处理“这个动作以前出现过”的细节恢复,滚动窗口保证相邻动作连续。三者组合后,系统无需保存完整历史也能持续校正外观。

第30秒到最后一分钟,画质分数只差0.021

团队设置了3分钟长视频基准,分别统计开头30秒和最后一分钟。LiveAnimate的图像质量评分IQA从4.047变为4.026,只下降0.021;作者报告人物身份也接近恒定。对照系统要么在长序列中明显退化,要么生成相同长度需要数小时离线计算。

不同方法在全身动作与外观保持上的定性对比

不同方法在全身动作与外观保持上的定性对比。

论文封面还展示了0秒、10秒、60秒、300秒和600秒的连续结果,说明架构本身不设固定视频终点。不过“稳定长时”来自论文所选人物、姿态和硬件环境;19.63 FPS也不是手机或普通显卡上的速度,部署成本仍取决于模型压缩和推理设备。

LiveAnimate长时生成中画质与身份指标的变化

LiveAnimate长时生成中画质与身份指标的变化。

下一步走向可交互直播和远程数字人

LiveAnimate已经把人物动画需要的三个条件放在同一系统里:实时返回、持续接收动作、固定大小记忆。直播数字人可以根据主播动作即时响应,远程呈现可以持续运行而不预设片长,虚拟角色也能在交互中重复动作时找回一致外观。

论文目前展示的是研究系统,并未说明面向公众的产品入口。接下来若要进入实际直播链路,还需处理单卡或消费级硬件速度、突发大动作、姿态检测误差以及更丰富服装和背景。现有结果至少表明,长视频生成不必在实时性和身份稳定之间二选一。

对开发团队而言,还可以分别记录每个视频块的生成时间和检索到的历史姿态,定位画面漂移究竟来自驱动信号还是记忆选择。

参考资料

https://arxiv.org/abs/2608.11745

https://liveanimate.github.io/