arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-04-01 至 2026-04-01 共收录 9 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 9 篇

2601.17094 2026-04-01 cs.LG cs.AI cs.CL 94%

The Mouth is Not the Brain: Bridging Energy-Based World Models and Language Generation

嘴巴不是大脑:连接基于能量的世界模型与语言生成

Junichiro Niimi

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出'嘴巴不是大脑'原则,通过基于能量的世界模型与语言模型分离,展示在消费者评论领域中,世界模型能提升生成质量与可控性,为语言能力与世界理解分离提供实证支持。

Comments ICLR 2026 The 2nd Workshop on World Models: Understanding, Modelling, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28887 2026-04-01 cs.CV cs.AI cs.RO 94%

OccSim: Multi-kilometer Simulation with Long-horizon Occupancy World Models

OccSim:基于长期占用世界模型的多公里模拟

Tianran Liu, Shengwen Zhao, Mozhgan Pourkeshavarz, Weican Li, Nicholas Rhinehart

机构 * Learning, Embodied Autonomy, and Forecasting (LEAF) Lab, University of Toronto(多伦多大学学习、具身自主与预测(LEAF)实验室)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 OccSim通过无需连续日志或HD地图,仅依赖初始帧和未来动作序列生成超过3000帧的3D占用地图,实现多公里规模的稳定生成,提升占用世界模型的生成长度达80倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19979 2026-04-01 cs.CV cs.AI 93%

X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving

X-World: 可控的以自身为中心的多摄像头世界模型用于可扩展的端到端驾驶

Chaoda Zheng, Sean Li, Jinhao Deng, Zhennan Wang, Shijia Chen, Liqiang Xiao, Ziheng Chi, Hongbin Lin, Kangjie Chen, Boyang Wang, Yu Zhang, Xianming Liu

机构 * GWM Team(长城汽车团队) XPeng Inc.(小鹏汽车)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 X-World通过可控的多摄像头生成世界模型,实现高质量多视角视频生成,支持跨摄像头一致性、长时间动态稳定性和严格动作遵循,为可扩展的端到端驾驶评估提供基础。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29090 2026-04-01 cs.LG cs.CV cs.RO 91%

HCLSM: Hierarchical Causal Latent State Machines for Object-Centric World Modeling

HCLSM:面向对象的世界建模的分层因果潜在状态机

Jaber Jaber, Osama Jaber

机构 * RightNow AI

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 HCLSM通过分层时序动态和因果结构学习,改进了基于视频预测未来状态的世界模型,实现了更精确的对象中心化表示和事件边界学习。

Comments 10 pages, 3 tables, 4 figures, 1 algorithm. Code: https://github.com/rightnow-ai/hclsm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06679 2026-04-01 cs.AI cs.CV cs.GR 87%

MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines

MultiGen:扩散游戏引擎中可编辑多人世界的层级设计

Ryan Po, David Junhao Zhang, Amir Hertz, Gordon Wetzstein, Neal Wadhwa, Nataniel Ruiz

机构 * Stanford University(斯坦福大学) Google(谷歌)

专题命中 通用世界模型 :world model(abstract);world models(abstract);video world model(abstract);world model(abstract)

AI总结 本文提出MultiGen,通过引入显式外部内存模块,实现可编辑多人世界中的环境控制与共享推理,提升交互性和一致性。

Comments Project page here: https://ryanpo.com/multigen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29572 2026-04-01 cs.GR cs.AI cs.CV 82%

Turbo4DGen: Ultra-Fast Acceleration for 4D Generation

Turbo4DGen: 4D生成的超快加速

Yuanbin Man, Ying Huang, Zhile Ren, Miao Yin

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出Turbo4DGen框架,通过时空缓存机制和动态语义感知注意力剪枝,显著减少4D生成中的冗余计算,实现9.7倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28955 2026-04-01 cs.AI 81%

Enhancing Policy Learning with World-Action Model

通过世界-动作模型增强策略学习

Yuci Han, Alper Yilmaz

机构 * Photogrammetry and Computer Vision Lab, The Ohio State University(俄亥俄州立大学摄影测量与计算机视觉实验室)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出World-Action Model,通过联合推理未来视觉观测和驱动状态转移的动作,提升策略学习效果。在CALVIN基准的八项任务中,WAM通过行为克隆和基于模型的PPO优化,显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18887 2026-04-01 cs.CV 69%

SafeDrive: Fine-Grained Safety Reasoning for End-to-End Driving in a Sparse World

SafeDrive: 为稀疏世界中的端到端驾驶进行细粒度安全推理

Jungho Kim, Jiyong Oh, Seunghoon Yu, Hongjae Shin, Donghyuk Kwak, Jun Won Choi

机构 * Seoul National University(首尔大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 SafeDrive提出了一种端到端规划框架,通过轨迹条件化的稀疏世界模型进行显式且可解释的安全推理,实现了在开放循环和闭合循环基准上的最佳性能,有效降低了碰撞率。

Comments Accepted to CVPR 2026, 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29036 2026-04-01 cs.CV 50%

Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos

从第一人称行走游览视频生成无人类环境 walkthroughs

Yujin Ham, Junho Kim, Vivek Boominathan, Guha Balakrishnan

机构 * Rice University(莱斯大学)

专题命中 通用世界模型 :environment model(abstract);分类 cs.CV

AI总结 本文提出一种生成算法,通过去除行走视频中的人和阴影效果,提升环境建模应用,使用半合成数据集训练Casper模型,实现高质量的无人类视频生成,进而构建三维/四维城市模型。

详情

展开后加载摘要…

URL PDF HTML 收藏