视频模型可以生成很像游戏的画面,却常在连续操控后让角色穿地、漂走或动作失真。Alaya Lab、上海创智学院、华中科技大学等团队提出Marionette,不让神经网络同时猜物理状态和像素,而是先生成276维显式3D角色状态,再由零参数几何桥接器与视频模型渲染画面。加入规则后,地面穿透错误减少66%。
纯像素世界模型把按键直接映射到下一段视频。短时间内画面很逼真,但像素里没有明确的骨架位置、朝向、生命值和地形约束,误差会随着自回归生成不断积累。Marionette将“角色接下来怎么动”与“动作看起来是什么样”拆开,让可控状态承担动力学,让生成模型专注视觉外观。
276维状态把骨架、位移和生命值写清楚
系统先由ActionGPT读取离散操作,预测流式动作Token;PoseGPT再把它们转成连续的276维关节与角色状态,其中包含骨架姿态、根节点移动和生命值等信息。方向、速度与旋转可以在这一层直接修改,不必在模糊的像素潜空间里寻找控制旋钮。
Marionette从动作Token到3D状态再到游戏画面的整体架构。
显式状态让同一动作能够跨画面风格复用,也能被规则检查。角色脚部低于地面时,系统知道这是几何冲突;根节点移动过快时,也可以在渲染前修正。控制信号因而从“希望画面像在向前走”变成确定的三维位移与姿态。
零参数图形桥把动作规则送进视频模型
276维向量不能直接作为直观画面条件。Marionette用零参数图形桥将骨架、相机和地形栅格化为控制图,再交给视频扩散模型生成带有游戏材质、光照与特效的RGB帧。几何部分按规则计算,外观部分由数据学习,二者通过分段回放保持长序列连续。
显式地形与角色骨架共同约束过桥和移动轨迹。
每个新片段继承上一段的状态和画面,操作者可以在流中改变方向、速度或动作类别。论文报告,增加控制后根节点对齐误差降低31%,说明输入不只是改变局部纹理,而是更准确地驱动角色真实位置。
图形桥本身不学习新参数,因而不会悄悄改变动作含义。相同的骨架与相机状态总会得到确定的控制渲染,视频模型只需决定材质、光照和细节如何呈现。这种确定性中间层也便于设计师查看问题究竟来自状态预测,还是来自最终画面生成。
长时生成少漂移,穿地错误降低66%
没有状态修复时,长序列中的角色会漂移21.2米,而记录轨迹本身约为5米;约三分之一帧出现地面穿透。加入规则与修复后,穿透错误减少66%,持续控制更接近目标路线。对可玩世界而言,这类几何稳定性往往比单帧美观更决定体验。
Marionette长时回放中角色轨迹与目标路线的对比。
实验仍建立在论文覆盖的角色、地图和动作空间内,复杂碰撞、多人交互与完全未知地形需要更多状态设计。但显式层使扩展路径很清楚:新增规则可以落在状态和图形桥中,无需期待视频模型自行从像素学会所有物理常识。
生命值等非视觉变量也进入状态流,说明框架并非只做姿态动画。游戏逻辑可以先更新数值和角色状态,再让观察模型把受击、倒地或环境反馈画出来。未来加入背包、任务进度和NPC关系后,同一机制可承载更完整的可玩状态。
不同角色类别下Marionette的控制误差比较。
下一步让生成世界既好看又真正可玩
Marionette可以继续接入碰撞体、道具、任务逻辑和多人状态,把短视频演示发展成可交互关卡。美术团队负责世界外观,设计师通过显式状态编辑速度、镜头和动作规则,生成模型则实时补全丰富画面,这种分工更贴近现有游戏制作管线。
当状态估计能从普通游戏录像自动提取,系统还可学习更多角色与地图,而不依赖完整引擎资产。未来若进一步降低视频生成延迟,并在长时间操作中维持物体恒常性,显式动力学加生成式渲染或许会成为开放世界模型从“能看”走向“能玩”的重要路线。