输入人物描述和长段讲话文本,不提供音轨,也不提供第一帧,模型可以一边生成声音一边生成画面。Vorch团队联合同济大学、哈工大(深圳)和上海交大公布Vorch-Streamer,在单张H200上达到27.12 FPS。
论文测试的是约两分钟的连续生成。22.8B参数流水线超过24 FPS播放线,词错率为7.92%,音画同步和人物一致性则通过多项指标比较。速度来自指定硬件与实现,不能直接推算到普通显卡。
音频和视频按同一时间块生成
传统数字人系统常先合成语音,再让头像对口型。Vorch-Streamer直接从文字联合生成音频与视频,并使用有界因果上下文:每次只读取有限历史,避免上下文随时长无限增长。
论文图1:三组约两分钟样例在0、30、60、90秒及末尾抽帧,并显示同步生成的音频波形。
训练先使用8万段、时长12至21秒的合成数字人片段,把Teacher Forcing与Diffusion Forcing混合,再用长时Self-Forcing让模型适应自己的历史输出。去噪被压到4步,才能把计算速度推过实时播放线。
论文图2:因果音视频生成、长时自回归训练和语言模型语音规划共同组成流式管线。
语言模型先规划“下一段该说什么”
只给整篇讲稿时,局部生成器并不知道当前时间块对应哪句话。系统加入语言模型语音规划通路,持续输出局部计划特征;规划与生成分离后,可以处理中断、换话题和静默监听,静默由可学习标记表达。
有限上下文能控制计算量,却可能逐步忘记人物与场景。论文用ArcFace比较人脸身份,用CLIP Image比较整体外观,并单独测动态程度,防止静止画面靠“没变化”拿到高一致性。
论文图3:曲线展示生成时长增加后,人脸身份和整体场景相对首帧的相似度变化。
实时成立,产品条件仍未给全
对照中,Vorch-Streamer比JoyAI-Echo快8.8倍,比双向LTX2.3快14.8倍;部分对手只支持30秒,部分还需要外部音频或首帧,任务条件并不完全相同。
论文没有给出多人对话、大幅转身、复杂手部动作和更长时段的系统性成功率,也未公布服务成本。27.12 FPS证明研究原型在一张H200上跨过播放帧率,不代表面向用户的实时数字人服务已经上线。