arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

生成视频真能玩了:Zing-0.5跑到24 FPS,每分钟不到1美分

作者:arXivDaily编辑部 arXiv 2609.17909 cs · cs.CV · cs.LG

论文导读

SeedLeap.ai推出5B参数世界模型Zing-0.5,让用户同时用键盘动作和在线文字指令改变正在生成的画面。论文报告它以832×480分辨率达到24 FPS,服务器租赁成本估算约每流分钟0.009美元;不过长期状态保持和动作后果仍有限,成本也会随部署条件变化。

生成视频从“看一段”变成“边玩边改”

普通文生视频在提交提示词后就按既定内容生成,用户很难中途干预。Zing-0.5把键盘动作与文字事件放进同一条条件序列:W、A、S、D控制移动,文字则可以要求场景发生新事件。雪地示例中,用户一边驾驶雪橇,一边输入欢呼或打开雨伞,模型无需重启整段视频便继续生成。

图1:雪地场景是论文展示的实时可玩世界之一。

难点在于两种控制的时间尺度不同:按键是连续、细粒度的,文字事件往往跨越数秒。团队用幅度感知的动作编码保留按键强度,把文本指令对齐到对应视频片段,并用同时标注动作与事件的视频训练,让导航和事件变化能在同一序列里协作。

文字改变事件,键盘继续控制运动

联合控制示例展示了画面在连续导航期间响应文字指令。雪橇并没有因为生成新事件而回到起点,后续按键仍能改变方向;其他案例还包括树释放金色火花、糖果屋融化等。这比“先生成一段,再生成下一段”更接近交互式系统。

图2:动作标签与文字事件被对齐到同一条生成时间线。

模型采用事件级教师与块级因果学生之间的分布匹配蒸馏。教师学习多提示词长视频中的事件连续性,学生则用四步生成和保留上下文的流式推理,逐块输出画面。这种设计把较强的长事件监督压进低延迟推理过程。

下一步:从实时片段走向持续可玩的世界

论文在832×480下报告24 FPS,并按服务器租赁价格估算每个视频流每分钟约0.009美元。WBench Navigation的158个案例中,Zing-0.5总体得分81.0,一致性得分88.5。多组长视频还展示了方向控制、物体变化和场景事件。

图3:论文给出的自然语言事件与连续生成案例。

这些数字不等于家用电脑实测成本:并发量、显卡利用率、服务框架和带宽都会改变账单。“可玩”也不代表拥有稳定的物理模拟,长时间生成仍可能遗忘物体状态,文本事件的后果也未必持续。Zing-0.5更准确的定位,是把世界模型从离线视频推进到低成本实时交互,并开源权重、推理代码和服务实现,便于外界检验延迟与一致性。后续若要用于游戏原型或具身训练,还需统一测量输入到画面的真实延迟、长时间物体记忆、多人并发成本,以及同一动作重复执行时结果是否稳定。

开放代码也让这些指标可以被独立复测。

参考资料

https://arxiv.org/abs/2609.17909

https://arxiv.org/html/2609.17909

https://zing.loopit.me/

https://github.com/seedleap/zing-world-model