arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

世界模型一操作就露馅:31个系统接受交互可靠性体检

作者:arXivDaily编辑部 arXiv 2609.24308 cs · cs.CV

论文导读

阿里巴巴、北京通用人工智能研究院、清华大学、南京大学等机构提出HappyWorld-Bench,把世界模型放进视频、空间和具身三条赛道。团队评测14个视频模型、9个空间系统和8个具身候选,重点检查交互后的状态保持与规则响应。

一张好看的画面,不等于一个可靠的世界

世界模型常用视频质量或人工偏好评分,但智能体真正进入生成环境后,会转动镜头、拿起物体、回到旧地点或修改规则。模型若只擅长连续生成像素,可能在回访时改变房间布局,也可能让已经移动的物体恢复原位。

HappyWorld-Bench用W1到W6描述能力层级:从生成构建,逐步增加交互模拟、状态保持、规则编辑、共享扩展和统一世界建模。三条赛道分别采用适合视频、三维空间和具身交互的协议,不把不同接入方式硬压成一个总分。

三条赛道覆盖31个系统

视频赛道含1138个提示,检查长时间生成、重访和动作响应;空间赛道含300个场景,测试放置、删除、编辑和扩展;具身赛道含254个案例,让模型面对单步动作、多步状态和改变后的物理规则。团队还运行HappyWorld-Arena,以人工两两比较形成Elo,并配合自动指标定位具体错误。

空间系统最好放置准确率为70.14%,最好编辑执行率为73.33%。这些数字说明当前系统可以完成一部分明确操作,却还不能稳定保持所有对象关系。不同赛道的模型、接口和评测维度不同,不能把两个百分比当成所有世界模型的统一成绩。

图:具身世界模型执行单个动作时出现的感知、状态或动作响应错误案例。

多走几步,状态错误开始累积

W3专门检查多步动作后的状态保持。模型可能正确完成第一次交互,却在后续画面中忘记物体已被拿走、门已经打开或角色位置发生变化。论文把感知质量、状态一致性、因果性和可控性分开计分,避免一张逼真画面遮住逻辑错误。

视频模型在延长生成和重访时一致性下降;具身模型也难以在多步链条中保存状态。失败图把连续画面放在一起,能看到动作结果与后续世界状态不匹配,而非只判断某一帧是否清晰。

图:多步交互序列中,模型未能持续保留先前动作造成的场景和对象状态。

W4要求在相同初始状态下修改规则,例如改变动作后果,再观察模型能否执行新规则并维持效果。系统可能表面改变一个对象,后续因果关系却仍按旧规则运行。论文因此同时检查干预是否执行、未修改部分是否保留、因果是否有效以及效果能否持续。

图:规则被修改后,具身世界模型在执行、因果响应或持续效果上出现的失败序列。

下一步要把可靠性接入智能体训练

HappyWorld-Bench目前提供的是评测框架,不是让所有模型变可靠的训练方法。后续可把失败类型变成训练反馈,让系统针对状态遗忘、错误因果和规则漂移分别修正。对游戏生成、机器人模拟和空间设计而言,可操作世界需要的不只是高画质,而是每次动作后都能给出可重复、可追踪的结果。

参考资料

https://arxiv.org/abs/2609.24308

https://arxiv.org/pdf/2609.24308

https://skyeval.com/sla/arena/happyworld