论文导读
清华大学、京东、东南大学等机构提出Routed Forcing,想解决实时数字人常见的“嘴在动,身体却像木头”的问题。团队发现,压缩视频生成模型时,动作丰富度主要在人物身体区域流失,于是只在需要的位置和训练阶段加入真实视频示范。在两套实验数据上,动作动态度最高提升约45%,同时维持口型同步和画面质量,让直播式数字人的表达更自然。
为什么数字人会越做越僵
一个能实时对话的数字人,需要边听声音边生成下一小段画面,不能等整段视频算完再播放。为了赶上这种速度,研究者常把较慢、画质更好的视频模型压成少步运行的轻量模型。压缩后,人物可能还会眨眼和张嘴,手势、头部和上身的变化却越来越像固定模板;同一段音频换不同随机起点,也常产出很相似的动作。
团队没有把整张画面的僵硬程度当成一个问题。论文的分区比较显示,人物身体区域的动作多样性下降最明显,嘴部下降较小,背景几乎不变。图中同一数字人在不同生成条件下的帧序列,以及旁边的分区数据,说明“要让人动起来”与“让背景稳定”并不是同一个训练目标。
图:教师与学生模型的人物帧序列和分区多样性统计,身体区域下降尤其明显。
把训练方法送到最需要的地方
Routed Forcing的思路可以用“分区补课”理解:身体和手势需要见到更多真实动作,于是用真实视频来教;嘴部和背景已经比较稳定,就沿用原来的压缩目标,避免口型漂移或背景抖动。它还区分训练的不同阶段:在动作轮廓尚不确定时引入真实视频,在细节逐渐成形时回到原有目标修饰画面。这样做并非换一套全新视频模型,而是重新决定训练信号“何时、作用在哪儿”。
方法图左侧是声音、首帧与生成中的画面,右侧是按人物、嘴部、背景及训练阶段分配目标的路由器。读图时只需抓住一点:论文没有对所有像素一视同仁。真实视频监督放在容易丢失动作的身体部分,而口型和场景稳定性仍由原目标维持。
图:训练路由器按人物区域和噪声阶段决定使用哪种监督信号。
实验里看到什么变化
论文在SpeakerVid和AVSpeech上比较了流式数字人的输出。相对Self Forcing基线,Routed Forcing的动作动态度指标最高提高45.6%,生成多样性提高约7%至25%,而画质和唇音同步保持在可比水平。这些是论文所报告的数据集与指标上的结果,不等于每个人、每个镜头都恰好更生动45%。
另一张对照图按时间排列人物画面:普通压缩方式里,人物手臂和上身变化有限;改用路由训练后,同样的音频条件下能看到更明显的动作变化。静态截图只能呈现部分帧差异,流畅度和时序自然程度仍应以原论文的视频演示为准。对应用者来说,重点是实时输出与动作表现可以一起优化,不必把“快”理解为“只能不动”。
图:三种训练方式的连续人物帧,用于比较手势与上身动作的变化。
未来的数字人,更像交流而不只是播报
虚拟主播、语音助手和远程交互角色都可能从这种分区训练思路受益。用户希望看到的不是一张稳定的脸在机械张嘴,而是说话时有自然配合的姿态;同时,直播场景也不能容忍长等待。Routed Forcing提供了一个清晰方向:先测出哪部分视觉表达被轻量化过程牺牲,再有针对性地补回来。后续若要进入真实产品,还需继续检验不同人物、长时间对话和复杂背景下的连贯性。