arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

PAPERDAILY REPORTS

数字人动画快13倍!苹果把建脸和动脸分开算

作者:arXivDaily编辑部 arXiv 2610.10945 cs · cs.CV · cs.LG

论文导读

苹果研究团队提出GHARP,用少量人物照片建立数字人,再用表情信号驱动脸部动画。它把一次性的建脸与持续的动脸分开计算。在论文的A100测试中,动画阶段相对对照方法最高快约13倍,输入照片增多时,每帧动画开销仍保持固定。

先把脸建好,再让表情动起来

照片中的人张嘴、抬眉,生成头像要跟着动,发型、肤色和身份又要保持。若每次表情变化都重新计算整个人物,大量重复工作会进入每一帧动画。

图:少量人物输入照片建立头像,并将驱动表情迁移到不同人物。

GHARP先在离线阶段整理人物的几何与外观,建立一个固定的三维表示。它使用三维高斯来描述人物,可理解为许多带位置、大小、方向和颜色的空间小块,渲染时把这些小块投到画面上。

运行阶段再读取表情信号,只预测相对于固定人物表示的变化。人物是谁与人物正在做什么表情,被放进两个计算阶段;较重的身份建模可以提前做,轻量网络负责持续动画。

几张照片合成同一个人物表示

论文使用预训练的重建模型,给不同输入照片建立一致的空间布局。这样,正面与侧面的线索能够合进同一个固定大小的人物表示,而不用把每张照片各自生成的结构直接堆起来。

图:GHARP先融合身份外观,运行时再预测表情带来的变化。

测试比较了1、2和4张输入照片。增加视角能补上原来没看到的外观信息,但GHARP输出的高斯数量不随照片数翻倍。Internal10K测试中,三种输入配置都使用约6.5万个高斯,动画阶段在A100上约1.92毫秒。

有4张输入时,FastGHA的动画阶段约26.25毫秒,GHARP约1.92毫秒,差距接近13.7倍。论文标题与摘要将其概括为最高约13倍。这里比较的是动画阶段,不能当成从上传照片到建模完成的全流程加速。

人物表情还可以迁移到不同身份。示例里同一驱动表情作用到多个人物,脸部动作相近,人物外观各自保留。

衣服不跟着脸乱抖,还要处理训练目标

表情信号描述脸,并不充分描述身体姿态和衣服位置。训练照片里,相近的面部表情可能对应不同的肩膀或衣服状态。模型若把这些冲突目标平均起来,身体区域就容易模糊、闪烁。

图:身体对齐模块减少表情信号无法确定的身体姿态歧义。

团队增加身体对齐网络,把目标图中的身体与参考图对齐,减少训练信号里的歧义。这一步重点处理脸之外的区域,不能把它理解成仅靠表情信号就能完整驱动全身动作。

对齐后,身体看起来更稳定,但与原目标图逐像素比较的指标可能下降,因为身体已经对齐到参考姿态,位置不再与原目标完全相同。论文因此同时报告身份、动作及图像质量指标,没有用单一分数包揽所有效果。

测试覆盖Ava-256与Internal10K,还比较了设备运行时间。数字人细节与稳定性仍要结合示例观察;已核实的速度结果落在指定硬件、输入配置和动画阶段。

参考资料

https://arxiv.org/abs/2610.10945

↑