论文导读
SeedLeap.ai推出5B参数世界模型Zing-0.5,让用户同时用键盘动作和在线文字指令改变正在生成的画面。论文报告它以832×480分辨率达到24 FPS,服务器租赁成本估算约每流分钟0.009美元;不过长期状态保持和动作后果仍有限,成本也会随部署条件变化。
生成视频从“看一段”变成“边玩边改”
普通文生视频在提交提示词后就按既定内容生成,用户很难中途干预。Zing-0.5把键盘动作与文字事件放进同一条条件序列:W、A、S、D控制移动,文字则可以要求场景发生新事件。雪地示例中,用户一边驾驶雪橇,一边输入欢呼或打开雨伞,模型无需重启整段视频便继续生成。
图1:雪地场景是论文展示的实时可玩世界之一。
难点在于两种控制的时间尺度不同:按键是连续、细粒度的,文字事件往往跨越数秒。团队用幅度感知的动作编码保留按键强度,把文本指令对齐到对应视频片段,并用同时标注动作与事件的视频训练,让导航和事件变化能在同一序列里协作。
文字改变事件,键盘继续控制运动
联合控制示例展示了画面在连续导航期间响应文字指令。雪橇并没有因为生成新事件而回到起点,后续按键仍能改变方向;其他案例还包括树释放金色火花、糖果屋融化等。这比“先生成一段,再生成下一段”更接近交互式系统。
图2:动作标签与文字事件被对齐到同一条生成时间线。
模型采用事件级教师与块级因果学生之间的分布匹配蒸馏。教师学习多提示词长视频中的事件连续性,学生则用四步生成和保留上下文的流式推理,逐块输出画面。这种设计把较强的长事件监督压进低延迟推理过程。
下一步:从实时片段走向持续可玩的世界
论文在832×480下报告24 FPS,并按服务器租赁价格估算每个视频流每分钟约0.009美元。WBench Navigation的158个案例中,Zing-0.5总体得分81.0,一致性得分88.5。多组长视频还展示了方向控制、物体变化和场景事件。
图3:论文给出的自然语言事件与连续生成案例。
这些数字不等于家用电脑实测成本:并发量、显卡利用率、服务框架和带宽都会改变账单。“可玩”也不代表拥有稳定的物理模拟,长时间生成仍可能遗忘物体状态,文本事件的后果也未必持续。Zing-0.5更准确的定位,是把世界模型从离线视频推进到低成本实时交互,并开源权重、推理代码和服务实现,便于外界检验延迟与一致性。后续若要用于游戏原型或具身训练,还需统一测量输入到画面的真实延迟、长时间物体记忆、多人并发成本,以及同一动作重复执行时结果是否稳定。
开放代码也让这些指标可以被独立复测。
参考资料
https://arxiv.org/abs/2609.17909