论文导读
Astronex Robotics和南京信息工程大学推出Astronex-World 1.0:输入文字或首帧后,用户可以持续控制相机、动作与角色类型,还能在生成中途插入事件。因果版以832×480、24fps输出,在一张NVIDIA L20上实时流式运行,把可交互世界模型压到5B参数规模。
视频不是一次生成完,而是边玩边往后长
普通视频生成通常在开始前固定提示词,模型算完一段后交付结果。交互世界模型需要在运行中持续接收动作:相机向前、人物左转、车辆加速,下一帧既要服从新指令,也要保持此前场景中的位置和外观。
Astronex-World同时提供双向版和因果版。双向版利用完整时间上下文生成整段视频;因果版把视频按块推进,保存跨块KV缓存,让前一段状态直接服务下一段。输入既可以是文字,也可以是一张初始图像。
图1:项目页汇总人物、室内、驾驶、游戏和自然环境等生成样例。
相机、动作和文字事件分三路进入模型
相机控制使用内外参编码,动作则压成64维连续向量,并调制每一层Transformer。角色或载具类型通过embodiment标识区分。用户还可以指定时间位置插入一句事件,让后续画面发生变化,而不是重新从第一帧生成。
训练分五个阶段:先学习相机与动作控制,再把双向骨干改成块因果生成;随后蒸馏少步采样学生,补回混合领域动态,最后用分布匹配改善画面质量。底座来自Wan2.2-TI2V-5B,五个阶段都在两张L20 48GB上运行。
图2:项目图展示视频潜变量、动作调制和持续生成之间的数据流。
单张L20实时跑,5B模型挑战更大系统
因果模型生成分辨率为832×480、帧率24fps,论文称可在一张L20上实时流式输出。WBench Navi得分73.5,WBench Full得分70.0;在作者列出的同表对比中,这个5B模型高于13.6B的LongCat-Video和14B的Helios,与22B的LTX-2.3相差不到1分。
图3:项目页展示宇航员、热气球、人物行走等场景随控制持续演化。
这些分数来自论文规定的WBench口径,不能外推成所有视频质量指标上的全面胜负。VBench样例也能看到静态物体、人物与室内场景的连续生成,但五秒级展示和长期稳定交互仍是不同难度。
图4:项目页列出床铺、葡萄、建筑和室内物体等5.2秒生成序列。
下一步是把预留动作接口接上真实任务
团队为具身智能与自动驾驶预留了动作输入和输出接口,但论文展示仍以生成环境为主,不代表机器人或车辆已经在现实中闭环运行。代码与权重已经提供,后续可检验更长交互中的身份保持、碰撞一致性、动作延迟,以及不同硬件上24fps能否稳定维持。
评测还应加入可重复操作:同一初始状态下连续执行转向、停止和回退,检查物体是否守恒、相机是否穿墙,以及事件插入后旧场景状态能否保留。世界模型只有在动作可验证时,才更接近训练智能体的环境。
参考资料
https://arxiv.org/abs/2609.20034
https://arxiv.org/html/2609.20034