arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

文字直接生成会说话的数字人,Vorch-Streamer跑到27.12 FPS

arXiv 2608.05663 cs.CV · cs.SD

输入人物描述和长段讲话文本,不提供音轨,也不提供第一帧,模型可以一边生成声音一边生成画面。Vorch团队联合同济大学、哈工大(深圳)和上海交大公布Vorch-Streamer,在单张H200上达到27.12 FPS。

论文测试的是约两分钟的连续生成。22.8B参数流水线超过24 FPS播放线,词错率为7.92%,音画同步和人物一致性则通过多项指标比较。速度来自指定硬件与实现,不能直接推算到普通显卡。

音频和视频按同一时间块生成

传统数字人系统常先合成语音,再让头像对口型。Vorch-Streamer直接从文字联合生成音频与视频,并使用有界因果上下文:每次只读取有限历史,避免上下文随时长无限增长。

Vorch-Streamer长时生成示例

论文图1:三组约两分钟样例在0、30、60、90秒及末尾抽帧,并显示同步生成的音频波形。

训练先使用8万段、时长12至21秒的合成数字人片段,把Teacher Forcing与Diffusion Forcing混合,再用长时Self-Forcing让模型适应自己的历史输出。去噪被压到4步,才能把计算速度推过实时播放线。

Vorch-Streamer方法结构

论文图2:因果音视频生成、长时自回归训练和语言模型语音规划共同组成流式管线。

语言模型先规划“下一段该说什么”

只给整篇讲稿时,局部生成器并不知道当前时间块对应哪句话。系统加入语言模型语音规划通路,持续输出局部计划特征;规划与生成分离后,可以处理中断、换话题和静默监听,静默由可学习标记表达。

有限上下文能控制计算量,却可能逐步忘记人物与场景。论文用ArcFace比较人脸身份,用CLIP Image比较整体外观,并单独测动态程度,防止静止画面靠“没变化”拿到高一致性。

长时身份与场景一致性曲线

论文图3:曲线展示生成时长增加后,人脸身份和整体场景相对首帧的相似度变化。

实时成立,产品条件仍未给全

对照中,Vorch-Streamer比JoyAI-Echo快8.8倍,比双向LTX2.3快14.8倍;部分对手只支持30秒,部分还需要外部音频或首帧,任务条件并不完全相同。

论文没有给出多人对话、大幅转身、复杂手部动作和更长时段的系统性成功率,也未公布服务成本。27.12 FPS证明研究原型在一张H200上跨过播放帧率,不代表面向用户的实时数字人服务已经上线。

参考资料

https://arxiv.org/abs/2608.05663

https://vorch-project.github.io/Vorch-Streamer-project/