arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-04-01 至 2026-04-01 共收录 14 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 9 篇

2601.17094 2026-04-01 cs.LG cs.AI cs.CL 94%

The Mouth is Not the Brain: Bridging Energy-Based World Models and Language Generation

嘴巴不是大脑:连接基于能量的世界模型与语言生成

Junichiro Niimi

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出'嘴巴不是大脑'原则,通过基于能量的世界模型与语言模型分离,展示在消费者评论领域中,世界模型能提升生成质量与可控性,为语言能力与世界理解分离提供实证支持。

Comments ICLR 2026 The 2nd Workshop on World Models: Understanding, Modelling, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28887 2026-04-01 cs.CV cs.AI cs.RO 94%

OccSim: Multi-kilometer Simulation with Long-horizon Occupancy World Models

OccSim:基于长期占用世界模型的多公里模拟

Tianran Liu, Shengwen Zhao, Mozhgan Pourkeshavarz, Weican Li, Nicholas Rhinehart

机构 * Learning, Embodied Autonomy, and Forecasting (LEAF) Lab, University of Toronto(多伦多大学学习、具身自主与预测(LEAF)实验室)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 OccSim通过无需连续日志或HD地图,仅依赖初始帧和未来动作序列生成超过3000帧的3D占用地图,实现多公里规模的稳定生成,提升占用世界模型的生成长度达80倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19979 2026-04-01 cs.CV cs.AI 93%

X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving

X-World: 可控的以自身为中心的多摄像头世界模型用于可扩展的端到端驾驶

Chaoda Zheng, Sean Li, Jinhao Deng, Zhennan Wang, Shijia Chen, Liqiang Xiao, Ziheng Chi, Hongbin Lin, Kangjie Chen, Boyang Wang, Yu Zhang, Xianming Liu

机构 * GWM Team(长城汽车团队) XPeng Inc.(小鹏汽车)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 X-World通过可控的多摄像头生成世界模型,实现高质量多视角视频生成,支持跨摄像头一致性、长时间动态稳定性和严格动作遵循,为可扩展的端到端驾驶评估提供基础。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29090 2026-04-01 cs.LG cs.CV cs.RO 91%

HCLSM: Hierarchical Causal Latent State Machines for Object-Centric World Modeling

HCLSM:面向对象的世界建模的分层因果潜在状态机

Jaber Jaber, Osama Jaber

机构 * RightNow AI

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 HCLSM通过分层时序动态和因果结构学习,改进了基于视频预测未来状态的世界模型,实现了更精确的对象中心化表示和事件边界学习。

Comments 10 pages, 3 tables, 4 figures, 1 algorithm. Code: https://github.com/rightnow-ai/hclsm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06679 2026-04-01 cs.AI cs.CV cs.GR 87%

MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines

MultiGen:扩散游戏引擎中可编辑多人世界的层级设计

Ryan Po, David Junhao Zhang, Amir Hertz, Gordon Wetzstein, Neal Wadhwa, Nataniel Ruiz

机构 * Stanford University(斯坦福大学) Google(谷歌)

专题命中 通用世界模型 :world model(abstract);world models(abstract);video world model(abstract);world model(abstract)

AI总结 本文提出MultiGen,通过引入显式外部内存模块,实现可编辑多人世界中的环境控制与共享推理,提升交互性和一致性。

Comments Project page here: https://ryanpo.com/multigen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29572 2026-04-01 cs.GR cs.AI cs.CV 82%

Turbo4DGen: Ultra-Fast Acceleration for 4D Generation

Turbo4DGen: 4D生成的超快加速

Yuanbin Man, Ying Huang, Zhile Ren, Miao Yin

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出Turbo4DGen框架,通过时空缓存机制和动态语义感知注意力剪枝,显著减少4D生成中的冗余计算,实现9.7倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28955 2026-04-01 cs.AI 81%

Enhancing Policy Learning with World-Action Model

通过世界-动作模型增强策略学习

Yuci Han, Alper Yilmaz

机构 * Photogrammetry and Computer Vision Lab, The Ohio State University(俄亥俄州立大学摄影测量与计算机视觉实验室)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出World-Action Model,通过联合推理未来视觉观测和驱动状态转移的动作,提升策略学习效果。在CALVIN基准的八项任务中,WAM通过行为克隆和基于模型的PPO优化,显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18887 2026-04-01 cs.CV 69%

SafeDrive: Fine-Grained Safety Reasoning for End-to-End Driving in a Sparse World

SafeDrive: 为稀疏世界中的端到端驾驶进行细粒度安全推理

Jungho Kim, Jiyong Oh, Seunghoon Yu, Hongjae Shin, Donghyuk Kwak, Jun Won Choi

机构 * Seoul National University(首尔大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 SafeDrive提出了一种端到端规划框架,通过轨迹条件化的稀疏世界模型进行显式且可解释的安全推理,实现了在开放循环和闭合循环基准上的最佳性能,有效降低了碰撞率。

Comments Accepted to CVPR 2026, 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29036 2026-04-01 cs.CV 50%

Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos

从第一人称行走游览视频生成无人类环境 walkthroughs

Yujin Ham, Junho Kim, Vivek Boominathan, Guha Balakrishnan

机构 * Rice University(莱斯大学)

专题命中 通用世界模型 :environment model(abstract);分类 cs.CV

AI总结 本文提出一种生成算法,通过去除行走视频中的人和阴影效果,提升环境建模应用,使用半合成数据集训练Casper模型,实现高质量的无人类视频生成,进而构建三维/四维城市模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 1 篇

2511.12882 2026-04-01 cs.RO cs.AI 94%

Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos

面向多视角轨迹视频的高一致性具身世界模型

Taiyi Su, Jian Zhu, Yaxuan Li, Chong Ma, Jianjun Zhang, Zitai Huang, Hanli Wang, Yi Xu

机构 * Midea Group(美的集团) Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 具身与机器人 :world model(title,abstract);embodied world model(title,abstract);world model(title,abstract);embodied world model(title,abstract)

AI总结 本文提出MTV-World模型,通过多视角轨迹视频控制实现精准的视觉-运动预测,解决低层次动作与真实物理交互不一致的问题,实验表明其在复杂双臂场景中表现优异。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模型式强化学习 3 篇

2603.28971 2026-04-01 eess.SY cs.LG cs.SY 76%

A Pontryagin Method of Model-based Reinforcement Learning via Hamiltonian Actor-Critic

基于汉密尔顿量的模型驱动强化学习方法:通过汉密尔顿演员-评论家方法

Chengyang Gu, Yuxin Pan, Hui Xiong, Yize Chen

机构 * Information Hub, HKUST (Guangzhou)(香港科技大学(广州)信息枢纽) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

专题命中 模型式强化学习 :model-based reinforcement learning(title,abstract);分类 cs.LG;dynamics model(abstract)

AI总结 本文提出汉密尔顿演员-评论家方法,通过直接优化汉密尔顿量避免价值函数学习,提升模型驱动强化学习的样本效率和鲁棒性。

Comments 18 pages, 4 figures, in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29409 2026-04-01 cs.RO 68%

CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics

CLaD:通过跨模态潜在动力学实现具有基础前瞻性的规划

Andrew Jeong, Jaemin Kim, Sebin Lee, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院)

专题命中 模型式强化学习 :latent dynamics(title);分类 cs.RO

AI总结 CLaD通过不对称跨注意力机制联合建模本体和语义状态演化,利用自监督目标和EMA编码器防止表征崩溃,实现高成功率的长序列动作生成。

Comments Project page: https://andrewwwj.github.io/clad

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29315 2026-04-01 cs.RO cs.AI 58%

IMPASTO: Integrating Model-Based Planning with Learned Dynamics Models for Robotic Oil Painting Reproduction

IMPASTO:整合基于模型的规划与学习的动力学模型用于机器人油画复现

Yingke Wang, Hao Li, Yifeng Zhu, Hong-Xing Yu, Ken Goldberg, Li Fei-Fei, Jiajun Wu, Yunzhu Li, Ruohan Zhang

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学)

专题命中 模型式强化学习 :dynamics model(title,abstract);分类 cs.AI、cs.RO

AI总结 IMPASTO通过整合学习的动力学模型与基于模型的规划,实现机器人基于目标油画图像的复现,无需人类示范或精确模拟,提升复现精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仿真与规划 1 篇

2512.05955 2026-04-01 cs.RO cs.CV 71%

SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models

SIMPACT:基于视觉-语言模型的仿真增强动作规划

Haowen Liu, Shaoxiong Yao, Haonan Chen, Jiawei Gao, Jiayuan Mao, Jia-Bin Huang, Yilun Du

机构 * UMD(马里兰大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学) Amazon FAR(亚马逊FAR) UPenn(宾夕法尼亚大学)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 SIMPACT通过仿真循环世界建模赋予视觉-语言模型物理推理能力,实现高效动作规划,优于现有通用机器人操作模型,在五个复杂真实世界任务中表现优异。

Comments Accepted to CVPR 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏