arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

阿里Wan-Animate-2把角色动画跑到24 FPS,还能用文字改机位

arXiv 2608.06009 cs.CV

上传一张角色图和一段驱动视频,系统可以让新角色复现动作,并用文字改变输出镜头。阿里巴巴通义实验室公布的Wan-Animate-2还提供轻量版,在400×720分辨率、4张NVIDIA H100上达到24 FPS。

论文把能力拆成两个版本。Base版优先保证动作、身份和视角控制,Lite版把扩散生成改造成分块自回归流程,面向数字人和直播等低延迟场景。作者称Base权重将公开,但论文发布时仍是计划状态。

不再先把动作压成骨骼或隐变量

常见角色动画会先从驱动视频提取2D骨骼、3D人体参数或压缩后的动作特征。提取误差会传进生成模型;不同体型之间迁移动作时,身份和细节也容易漂移。另一类方法直接让目标序列关注整段驱动视频,却要承担随序列长度平方增长的注意力成本。

Wan-Animate-2让驱动视频直接进入双分支扩散Transformer。参考分支保存干净的动作信息,生成分支处理带噪潜变量;Time-Align RoPE对齐两条分支的时间位置,稀疏参考注意力只连接对应时刻,减少跨序列计算。

Wan-Animate-2整体框架

论文图1:双分支DiT分别处理驱动视频与生成潜变量,并在对应时间位置交换参考信息。

每8帧生成一块,错误也要提前喂给模型

Lite版把输入切成8帧一组,后一组依赖此前已经生成的潜变量。训练时若始终使用无误差真值,部署后会因前一组的小错误持续累积。团队加入错误缓冲,把模型真实残差注入训练上下文,再用Self-Forcing把多步去噪压缩到3步。

Wan-Animate-2-Lite流式推理

论文图2:Lite版按8帧分块自回归生成,上一块输出会成为下一块的条件。

14B模型的蒸馏没有对整段序列保留梯度,而是先完成无梯度推理,再逐块回传并累积梯度,降低峰值显存。实时测试仍用了4张H100:一张编码、两张运行3步DiT去噪、一张解码。24 FPS不能直接套用到单卡消费级硬件。

文字能改镜头,结果仍来自论文环境

团队用Unreal Engine渲染12个方位角与4个俯仰角,共48种机位,以“右侧60度”“俯视”等文字训练Viewpoint LoRA。用户不必输入旋转矩阵,输出视角也不再被驱动视频锁死。

跨角色动作迁移示例

论文图3局部:同一驱动动作被迁移到外观和体型不同的角色。

论文给出定性结果和用户研究,但实时吞吐依赖服务器级多卡配置,连续直播中的稳定时长、端到端延迟和线上并发成本尚未公开。它目前是一套研究系统,不能等同于已经上线的通义产品功能。

参考资料

https://arxiv.org/abs/2608.06009

https://humanaigc.github.io/wan-animate-2/