arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

英伟达等做出SolarWM:只看5秒训练片段,也能实时推演数小时

作者:arXivDaily编辑部 arXiv 2609.02886 cs · cs.CV

论文导读

香港中文大学(深圳)、新加坡国立大学、英伟达、微软亚洲研究院等机构联合提出SolarWM,把10个数据集的143万段视频整理成统一训练流水线。模型只用5秒序列训练,却能连续生成分钟到小时级实时轨迹,方便研究者比较不同视频骨干;这些轨迹仍是固定提示和相机路径下的模型推演,不等同于可靠预测真实世界。

先把十套视频数据说成同一种语言

训练交互式世界模型,麻烦不只在模型大小。不同视频数据的时长、帧率、相机运动、清晰度和文字描述都不一样;直接混合后,同一个训练批次里的监督信号可能互相冲突,换一种视频骨干又要重写处理逻辑。

SolarWM的数据引擎把10个来源的约143万段视频转换成逐帧对齐的统一记录,保存画面、相机几何、描述、质量标签、筛选决定和来源信息,实体数据超过25TB。数据预处理与混合比例分开后,研究者调整过滤条件或采样权重时,不必重新跑最耗时的源处理。

图:论文图2展示多源视频进入统一记录、质量筛选和训练混合的流程。

四种骨干共用三阶段训练

团队没有要求所有模型改成同一种内部表示,而是在统一相机条件、训练和推理接口下,保留Wan2.2、LTX-2.5和MiniMax-H3等骨干原有结构,实例化4个规模从50亿到330亿参数的模型。这样比较不同路线时,数据契约和评估流程保持一致。

训练先让模型双向理解短视频,再用教师强制方式初始化自回归生成,最后做分布匹配蒸馏,把多步生成压到适合实时交互的因果模型。论文的SolarWM-5B流程把数据处理、三阶段训练和长时推演放在同一张图里,重点是跨骨干复用,而非只展示一个模型的单次演示。

图:论文图1给出SolarWM-5B的三阶段训练以及小时级推演示例。

从5秒训练片段延伸到60分钟

模型训练时看到的是5秒序列,推理时则从一张真实首帧开始,沿预设相机轨迹不断把刚生成的画面接到下一段。分钟级测试包含域内场景和未见分布场景,提示词在整个生成过程中保持不变,用来观察主体、布局和相机响应是否持续稳定。

图:论文图8展示同一会话中的分钟级域内连续生成帧。

小时级样例来自一次不中断的自回归会话,论文从起始画面一直抽帧到第60分钟。它证明系统能够继续运行,并不证明每一处物体关系在一小时后仍与真实未来一致;长序列还可能累积外观漂移、几何错误和事件重复。

图:论文图11从同一小时级生成会话抽取稀疏帧,终点为第60分钟。

开放流水线下一步要测交互正确性

项目计划提供处理后的数据、筛选记录、训练方案、权重和代码。对世界模型研究者,价值在于能在相同数据契约下更换骨干和混合比例,再比较长时生成,而不是从抓取和清洗视频重新开始。

下一步评估需要加入可核对的交互目标:相机转向后位置是否一致,物体移动后能否保持状态,用户动作是否产生正确后果。只有把画面连贯、几何稳定和动作结果分别计分,小时级运行时长才可能转化为机器人训练、游戏环境或交互模拟中的可用指标。

参考资料

https://arxiv.org/abs/2609.02886

https://junchao-cs.github.io/SolarWM-Web/

https://github.com/Junchao-cs/SolarWM