arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

腾讯港中文等提出ForgeWM:一步生成可玩的游戏世界,回放还能继续精修

arXiv 2608.14022 cs.AI · cs.CV

扩散世界模型画面越精细,往往要去噪越多步,玩家按键后只能等待;压到一步生成,速度上去了,细节和稳定性又容易下降。腾讯PCG、香港中文大学、复旦大学、上海人工智能实验室、香港科技大学等团队提出ForgeWM,训练1、2、4步不同速度的学生模型,并让系统沿已经走过的轨迹回放精修,在保持即时交互的同时逐渐提高画质。

可玩世界模型根据当前画面和键鼠或手柄动作预测下一段视频。它既要像游戏引擎一样及时响应,又要像生成模型一样补全复杂场景。传统多步扩散每一帧需多次运行网络,交互延迟高;一步蒸馏虽然快,却把所有结构和纹理决定压进一次计算,误差会随玩家持续操作累积。

同一教师模型蒸馏出1、2、4步三个速度档

ForgeWM从高质量教师模型出发,分别训练一步、两步和四步学生。部署时可根据显卡预算与交互需求切换:一步版本优先低延迟,四步版本提供更高画质,两步位于中间。不同版本共享动作条件,覆盖Minecraft式探索与CrossFPS手柄控制场景。

ForgeWM从多步教师蒸馏出不同推理步数的整体框架

ForgeWM从多步教师蒸馏出不同推理步数的整体框架。

这种分档比只发布一个固定模型更接近游戏设置。实时操作阶段需要迅速响应转向、开火和移动;观战、重播或算力空闲时,则可以花更多计算改善远处结构与纹理。开发者能够用同一世界模型按场景分配延迟预算。

一步、两步和四步学生也提供了清晰的速度—质量曲线。系统不必为了最低延迟永久牺牲所有画质,也不必让每一次简单移动都承担最高推理成本。统一蒸馏框架让三个档位保持相近的动作语义,切换时更容易延续玩家控制。

先一步生成,走过的轨迹还能回放精修

ForgeWM的关键设计是Replay Refinement。玩家第一次探索时使用一步模型快速生成,系统保存动作和视频轨迹;随后把已有结果作为起点重新去噪,而不是从纯噪声再造一遍。已经确定的场景和动作成为强条件,使精修版既提升质量,又保持与原始游玩过程一致。

ForgeWM生成Minecraft与第一人称射击场景的连续操作画面

ForgeWM生成Minecraft与第一人称射击场景的连续操作画面。

论文报告,回放精修能达到接近四步生成的质量;与从噪声重新生成相比,它生成的结果约3倍更接近玩家实际经历的轨迹。这个指标很重要:重播如果出现另一条道路、不同敌人或错位动作,即使单帧更漂亮,也无法忠实复现游戏过程。

已有轨迹相当于给精修过程提供了时空锚点。模型可以纠正模糊纹理和局部结构,却不必重新决定玩家走向、镜头转动与事件顺序。对精彩片段导出和内容审核而言,增强版与原始操作保持对应,比重新抽样一段相似视频更有实际意义。

用户研究同时检验画质、控制与轨迹一致性

团队不仅比较图像指标,还通过用户研究评估画面质量、操作响应和整体体验。Minecraft测试强调长距离移动与场景延续,CrossFPS则加入手柄输入、快速转向和战斗动作,检验模型能否及时响应连续控制。

用户研究比较不同生成步数下的视觉质量和可玩体验

用户研究比较不同生成步数下的视觉质量和可玩体验。

一步模型的实时性和回放精修的画质提升来自论文设定的分辨率、硬件与游戏域,距离完整商业游戏仍有角色逻辑、长期记忆和精确碰撞等环节。不过,ForgeWM已经给出一种实际调度方式:首遍优先可玩,后续利用空闲算力逐渐增强,而不是要求一次生成同时做到所有目标。

ForgeWM回放精修与从噪声重新生成的轨迹一致性对比

ForgeWM回放精修与从噪声重新生成的轨迹一致性对比。

下一步让生成世界按算力动态升级

Replay Refinement可以继续扩展到云游戏、玩家精彩回放和用户生成内容。移动端先接收低步数结果保证操控,云端沿同一动作日志生成高质量版本;创作者也可固定满意的路线,只重做光照、材质或镜头,而不改变事件顺序。

更长远看,系统可以根据运动强度和画面复杂度动态选择步数:激烈战斗用一步保障延迟,静止观察时自动增加精修。若再接入显式游戏状态、音频和多人同步,ForgeWM展示的“快速草稿加轨迹忠实精修”可能成为生成式游戏世界兼顾交互与品质的一条可落地路径。

参考资料

https://arxiv.org/abs/2608.14022