世界模型生成的视频可能每一帧都很漂亮,但让AI玩家转身、开门、绕一圈再回来,房间结构和物体状态还能对得上吗?快手、香港中文大学、香港大学和浙江大学推出PlayWorld,用Agent玩家在171个交互场景里实测9个世界模型,把评估从“看视频像不像”推进到“这个世界能不能长期玩”。
传统视频指标比较生成帧与参考帧的像素或特征,适合短片,却难判断一个可交互环境是否遵循稳定规则。玩家的动作会不断改变观察,镜头外的内容又没有即时监督;模型只要悄悄改了门的位置或忘掉刚移动的物体,长任务就会失败。
让Agent带着目标行动,而不是被动观看样片
PlayWorld为每个场景设定可执行目标,由Agent玩家根据当前画面选择移动和交互动作,世界模型再生成下一段观察。系统记录整条轨迹,并判断玩家是否能完成目标。这样的闭环会主动访问模型薄弱区域,比固定动作脚本更容易发现累积错误。
PlayWorld用Agent玩家在生成世界中持续行动并完成目标。
171个场景覆盖导航、物体交互和状态变化,9个世界模型在相同目标下接受比较。Agent既是测试者也是探针:若世界保持一致,合理策略应持续取得进展;若生成环境突然改写空间或交互反馈,玩家即使做出正确动作也会被误导。
四类能力专门盯住长时间后才暴露的问题
基准从几何一致性、交互保真度、视野外演化和洞察演化四个维度评估。几何一致性关注转弯后墙、门和路径是否仍在原位;交互保真度检查动作是否带来稳定结果;视野外演化考察离开镜头的对象是否按规律保持或变化;洞察演化则关注模型能否随交互逐步显露合理的新信息。
PlayWorld对世界模型的几何、交互与视野外状态进行分项评估。
这些维度解释了为什么短时画质不是可靠替代指标。一个模型可以生成逼真的房间,却在玩家回头时把出口换到另一边;也可能视觉上连续,但按下开关后没有持续保存灯光状态。只有把动作、观察和历史放到同一条轨迹里,问题才会显现。
9个模型同场测试,当前系统仍难成为可靠环境
论文结果显示,现有模型在171个预设目标场景中普遍无法稳定维持长程空间与状态。不同系统各有强项,但没有一个能在四类能力上同时可靠。PlayWorld因此不只给总分,还保留失败发生在哪一步、属于哪种一致性问题,方便模型开发者定位训练缺口。
Agent执行交互动作后世界模型返回的新观察。
PlayWorld记录一个交互任务完成时的世界状态。
结论来自特定Agent策略、171个场景与9个受测模型,Agent本身的规划错误也可能影响成功率。团队通过分项检查与轨迹证据尽量区分“玩家选错动作”和“世界没有按规则响应”,但未来仍需要更多人工复核和不同玩家策略交叉验证。
下一步为游戏、机器人和具身智能建立可玩的训练场
PlayWorld把评估对象从单段视频变成持续响应的环境,这对游戏原型、机器人仿真和具身Agent训练都很关键。开发者可以用失败轨迹反向构造训练样本,专门补充回头重访、遮挡后保持、物体状态持续等长程规律,而不是继续只增加随机视频。
未来基准还可以加入多人互动、可组合工具和更长任务,并让人类与多种Agent共同试玩。若世界模型能在这些压力测试下保持空间和因果状态,它才可能成为低成本的可生成模拟器。PlayWorld给出的171个场景和四维诊断体系,为这条路线提供了比“看起来很真实”更接近实际用途的进度尺。
训练侧也可以把四类指标变成课程:先学习短距离几何回环,再加入离开视野后的物体保持,最后处理需要多步因果链的任务。每次失败都留下动作与画面轨迹,可自动定位最早发生的不一致帧。相比只用最终成功或失败作为奖励,这类细粒度反馈更容易告诉模型究竟该修哪条世界规律。