arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

单张L20跑实时世界模型,Astronex用5B参数硬刚百亿模型

作者:arXivDaily编辑部 arXiv 2609.20034 cs · cs.AI · cs.CV · cs.RO

论文导读

Astronex Robotics和南京信息工程大学推出Astronex-World 1.0:输入文字或首帧后,用户可以持续控制相机、动作与角色类型,还能在生成中途插入事件。因果版以832×480、24fps输出,在一张NVIDIA L20上实时流式运行,把可交互世界模型压到5B参数规模。

视频不是一次生成完,而是边玩边往后长

普通视频生成通常在开始前固定提示词,模型算完一段后交付结果。交互世界模型需要在运行中持续接收动作:相机向前、人物左转、车辆加速,下一帧既要服从新指令,也要保持此前场景中的位置和外观。

Astronex-World同时提供双向版和因果版。双向版利用完整时间上下文生成整段视频;因果版把视频按块推进,保存跨块KV缓存,让前一段状态直接服务下一段。输入既可以是文字,也可以是一张初始图像。

图1:项目页汇总人物、室内、驾驶、游戏和自然环境等生成样例。

相机、动作和文字事件分三路进入模型

相机控制使用内外参编码,动作则压成64维连续向量,并调制每一层Transformer。角色或载具类型通过embodiment标识区分。用户还可以指定时间位置插入一句事件,让后续画面发生变化,而不是重新从第一帧生成。

训练分五个阶段:先学习相机与动作控制,再把双向骨干改成块因果生成;随后蒸馏少步采样学生,补回混合领域动态,最后用分布匹配改善画面质量。底座来自Wan2.2-TI2V-5B,五个阶段都在两张L20 48GB上运行。

图2:项目图展示视频潜变量、动作调制和持续生成之间的数据流。

单张L20实时跑,5B模型挑战更大系统

因果模型生成分辨率为832×480、帧率24fps,论文称可在一张L20上实时流式输出。WBench Navi得分73.5,WBench Full得分70.0;在作者列出的同表对比中,这个5B模型高于13.6B的LongCat-Video和14B的Helios,与22B的LTX-2.3相差不到1分。

图3:项目页展示宇航员、热气球、人物行走等场景随控制持续演化。

这些分数来自论文规定的WBench口径,不能外推成所有视频质量指标上的全面胜负。VBench样例也能看到静态物体、人物与室内场景的连续生成,但五秒级展示和长期稳定交互仍是不同难度。

图4:项目页列出床铺、葡萄、建筑和室内物体等5.2秒生成序列。

下一步是把预留动作接口接上真实任务

团队为具身智能与自动驾驶预留了动作输入和输出接口,但论文展示仍以生成环境为主,不代表机器人或车辆已经在现实中闭环运行。代码与权重已经提供,后续可检验更长交互中的身份保持、碰撞一致性、动作延迟,以及不同硬件上24fps能否稳定维持。

评测还应加入可重复操作:同一初始状态下连续执行转向、停止和回退,检查物体是否守恒、相机是否穿墙,以及事件插入后旧场景状态能否保留。世界模型只有在动作可验证时,才更接近训练智能体的环境。

参考资料

https://arxiv.org/abs/2609.20034

https://arxiv.org/html/2609.20034

https://world.astronex.com.cn

https://github.com/Astronex-Robotics/Astronex-World

https://huggingface.co/Astronex-Lab/Astronex-World