发表机构
Tsinghua University; Shengshu Technology(清华大学; 生数科技)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
介绍实时交互式视频生成模型Vidu S1,支持数字角色语音控制,用户可随时通过语音指令控制视频内容,基于TurboDiffusion和TurboServe构建,能实时生成高质量视频,性能优且满足实时推理需求。
AI 中文摘要
我们介绍了Vidu S1,一个支持数字角色语音控制的实时交互式视频生成模型。用户可以通过语音指令随时控制视频生成内容。Vidu S1支持无限长度的实时视频生成,无模糊、漂移或视觉失真。基于TurboDiffusion和TurboServe构建,Vidu S1在普通消费级GPU上以高达42 FPS的速度输出540p实时视频。用户可以上传真实人物、动漫和宠物的自定义图像,并选择不同的语音语调以获得个性化体验。实验表明,Vidu S1在所有测试指标上都取得了最佳性能,同时完全满足实时推理要求。可在这个https URL上获得可播放的在线演示。
英文摘要
We introduce Vidu S1, a real-time interactive video generation model supporting voice control of digital characters. Users can control video generation content at any moment through voice instructions. Vidu S1 supports infinite-length real-time video generation without blurring, drift, or visual distortion. Built with TurboDiffusion and TurboServe, Vidu S1 outputs 540p real-time videos at up to 42 FPS on regular consumer GPUs. Users can upload custom images of real people, anime, and pets, and choose different voice tones for personalized experiences. Experiments show that Vidu S1 achieves the best performance across all test metrics while fully meeting real-time inference requirements. A playable online demo is available at https://vidu.com/vidu-stream.