论文导读
北京大学与香港中文大学(深圳)团队提出Motion-Omni,让数字人在生成语音的同时生成面部表情和全身动作。Motion-Omni-Q7相对“语音模型再接动作模型”的级联系统响应快5.4倍,实时因子为0.78。实验说明联合生成能降低等待,但开放式动作存在随机性,不能把单次演示当成稳定复现。
数字人过去要先开口,再决定怎么动
传统对话数字人通常走两段流程:语言模型和语音合成先输出声音,动作模型再读取完整音频,补上口型、表情与手势。好处是模块成熟,问题是第二个模型必须等待音频,交互延迟被串联放大;语气变化与动作意图也可能在接口处丢失。
Motion-Omni把语音和运动放进一次自回归生成。系统保留强语音模型的语言能力,同时增加用于面部和身体的运动标记;在同一上下文里,下一段声音与下一段动作共同决定。这样,“迟疑地解释”或“兴奋地回应”不必先压扁成音频再被另一个模型猜回来。
图:项目页框架图展示文本、语音、面部与全身动作在统一生成流程中的关系。
1402小时数据把说话和身体重新对齐
团队构建了1402小时带语音、面部和全身动作的训练数据。训练并非让所有模块一起剧烈更新:论文比较后发现,冻结部分语音能力并不能自动得到好动作,因为运动分支还需理解对话语义、节奏和人物状态;因此设计了分阶段训练与对齐目标,让语音质量和动作自然度互不拖累。
模型还能接收文字指令控制回应风格。演示里,同一句具有指导、安慰或强调意味的话,会出现不同手势幅度和身体姿态,而口型继续跟随声音。它生成的是合理动作分布,不是从文本检索一条固定动画。
图:论文定性示例展示数字人说话时连续变化的面部、手势和身体姿态。
0.78实时因子意味着说完前已经开始动
实时因子RTF小于1,表示生成一段内容所需时间短于内容播放时长。论文报告Motion-Omni-Q7的RTF为0.78,响应速度是级联系统的5.4倍。由于语音与动作流式输出,用户不用等完整话语合成完毕,数字人的动作就能开始播放。
质量评估覆盖语音可懂度、身份与韵律、口型同步、身体运动自然度以及文字与动作一致性。结果显示联合模型在维持语音表现的同时,动作指标可与使用同一音频教师的级联系统竞争。需要注意,这类指标未唯一规定“正确手势”,主观评审和采样方差仍会影响结论。
图:论文示例呈现不同人物特质提示对应的连续动作,说明开放动作并非固定答案。
从播报员走向可打断的对话角色
联合生成适合客服、虚拟教师、游戏角色和远程化身:系统能更早给出非语言反馈,也更容易把情绪、强调和停顿贯穿到声音与身体。但论文演示以单人说话为主,复杂多人互动、物体接触、长时间身份一致性以及被用户中途打断后的重规划仍待验证。
真正进入产品还需测量端到端首包延迟,而不只是整段RTF;也要针对不同语言、镜头裁切和身体尺度做真人评审。速度优势已明确,稳定自然地“边听边说边动”才是下一关。
参考资料
https://arxiv.org/abs/2609.04250