arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-05-28 至 2026-05-28 共收录 15 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 7 篇

2605.28317 2026-05-28 cs.LG cs.AI cs.NA math.NA physics.comp-ph 94%

Hybrid Neural World Models

混合神经世界模型

Pranav Lakshmanan, Paras Chopra

机构 * Lossfunk

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出混合神经世界模型,通过单网络连续视界条件训练直接预测未来状态,并利用误差图隐式捕捉不连续性,实现高效且可靠的物理动力学模拟。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28277 2026-05-28 cs.AI 93%

Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning

LLMs 是否从文本构建世界模型?多语言空间推理诊断

Zhikai Pan, Chih-Ting Liao, Chunrui Liu, Xi Xiao, Yitong Qiao, Chunlei Meng, Zhangquan Chen, Xin Cao

机构 * University of New South Wales(新南威尔士大学) Essential Energy University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 通过多语言诊断基准 MentalMap 评估大语言模型的空间推理能力,发现所有模型在视角推理上存在普遍的性能瓶颈(L3 推理悬崖),表明该限制源于纯文本工作记忆约束而非特定架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27589 2026-05-28 cs.CV 91%

What-If World: A Causal Benchmark for General World Models in Embodied Scenarios

What-If World: 具身场景中通用世界模型的因果基准

Kunlin Cai, Rui Song, Jinghuai Zhang, Kaiyuan Zhang, Pranav Bodapati, Alicia Yu, Fnu Suya, Mohammad Rostami, Jiaqi Ma, Yuan Tian

机构 * UCLA(加州大学洛杉矶分校) University of Tennessee(田纳西大学) Amazon(亚马逊)

专题命中 通用世界模型 :world model(title,comments);world models(title);world model(title,comments);world models(title)

AI总结 提出 What-If World 基准,通过成对提示测试视频生成模型在物理变化下的因果一致性,发现现有模型在因果干预上表现不佳。

Comments 38 pages, World Model Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28816 2026-05-28 cs.CV 90%

Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

Gamma-World: 超越双玩家的生成式多智能体世界建模

Fangfu Liu, Kai He, Tianchang Shen, Tianshi Cao, Sanja Fidler, Yueqi Duan, Jun Gao, Igor Gilitschenski, Zian Wang, Xuanchi Ren

机构 * NVIDIA Tsinghua University(清华大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 提出一种生成式多智能体世界模型,通过Simplex Rotary Agent Encoding实现智能体置换等价性,并采用Sparse Hub Attention降低跨智能体注意力成本,支持多玩家交互视频生成。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/gamma-world

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28111 2026-05-28 cs.LG 88%

Chreode: A Cell World Model for One-Step Temporal Dynamics and Perturbation Prediction

Chreode: 用于一步时间动态和扰动预测的细胞世界模型

Mufan Qiu, Genhui Zheng, Yinuo Xu, Ruichen Zhang, Ying Ding, Qi Long, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.LG

AI总结 提出Chreode,一种基于结构化残差转移算子的单步细胞世界模型,通过预训练和微调实现发育轨迹与扰动预测的统一,在多个基准上取得性能提升。

Comments 25 pages, 3 figures, 14 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19355 2026-05-28 cs.LG cs.AI cs.CE 71%

LASER: Learning Active Sensing for Continuum Field Reconstruction

LASER: 用于连续场重建的学习主动感知

Huayu Deng, Jinghui Zhong, Xiangming Zhu, Yunbo Wang, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能MOE重点实验室、人工智能研究院、计算机科学学院、上海交通大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 提出LASER框架,将主动感知建模为部分可观测马尔可夫决策过程,利用连续场潜在世界模型和强化学习策略在潜在想象空间中模拟感知场景,实现稀疏约束下的高保真重建。

Comments Accepted by ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28230 2026-05-28 cs.CV 69%

Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation

Proprio: 用于物理合理视频生成的潜在自评分与推理时精炼

Mariam Hassan, Kaouther Messaoud, Wuyang Li, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Télécom Paris(巴黎电信学院)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.CV

AI总结 提出Proprio,一种无需训练框架,通过分析模型在潜在扰动下的流残差作为自评分信号,结合最佳N搜索和梯度自精炼,提升冻结视频生成器输出的物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 3 篇

2605.27817 2026-05-28 cs.RO cs.AI cs.CV cs.LG 84%

Turning Video Models into Generalist Robot Policies

将视频模型转化为通用机器人策略

Sizhe Lester Li, Evan Kim, Xingjian Bai, Tong Zhao, Tao Pang, Max Simchowitz, Vincent Sitzmann

机构 * MIT(麻省理工学院) CMU(卡内基梅隆大学) Amazon FAR(亚马逊公司)

专题命中 具身与机器人 :world model(abstract);video world model(abstract);world model(abstract);video world model(abstract)

AI总结 提出一种解耦的视频到动作策略VERA,利用无动作视频世界模型和基于机器人雅可比矩阵的逆动力学模型,实现跨本体的零样本机器人控制。

Comments project page: https://vera.csail.mit.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27491 2026-05-28 cs.RO 81%

GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation

GE-Sim 2.0:迈向机器人操作综合闭环视频世界模拟器的路线图

Boxiang Qiu, Liliang Chen, Yue Liao, Nan Wang, Lintao Wang, Jiayi Luo, Wenzhi Zhao, Shengcong Chen, Di Chen, Ye Li, Chen Gao, Shuicheng Yan, Si Liu, Maoqing Yao, Guanghui Ren

机构 * AgiBot BUAA(北京航空航天大学) LV-NUS Lab(国立大学理工学院实验室) TJU(天津大学)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出GE-Sim 2.0,一种基于动作条件视频生成的闭环视频世界模拟器,通过重新训练数千小时真实机器人数据并新增状态专家、世界裁判和加速框架三个模块,实现高保真动作跟随和轨迹覆盖,在WorldArena排行榜上以2B参数超越专用模型和通用视频生成器,并验证了基于其生成轨迹和奖励训练的策略在真实世界中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09882 2026-05-28 cs.RO cs.AI 71%

Emerging Extrinsic Dexterity in Cluttered Scenes via Dynamics-aware Policy Learning

杂乱场景中通过动力学感知策略学习涌现的外在灵巧性

Yixin Zheng, Jiangran Lyu, Yifan Zhang, Jiayi Chen, Mi Yan, Yuntian Deng, Xuesong Shi, Xiaoguang Zhao, Yizhou Wang, Zhizheng Zhang, He Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Galbot Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

AI总结 提出动力学感知策略学习框架,通过显式世界建模学习接触诱导物体动力学表示并用于强化学习,使杂乱场景中的外在灵巧性无需手工启发式或复杂奖励塑造即可涌现。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project page: https://pku-epic.github.io/DAPL/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 自动驾驶 2 篇

2605.18137 2026-05-28 cs.CV 90%

Xiaomi Auto World Model: A Joint World Model Integrating Reconstruction and Generation for Autonomous Driving

小米自动驾驶世界模型:一个融合重建与生成的联合世界模型

Lijun Zhou, Hongcheng Luo, Zhenxin Zhu, Cheng Chi, Mingfei Tu, Kaixin Xiong, Lei Gong, Zhanqian Wu, Zehan Zhang, Fangzhen Li, Hao Li, Yingying Shen, Jiale He, Haohui Zhu, Shan Zhao, Kai Wang, Zhiwei Zhan, Yuechuan Pu, Kaiyuan Tan, Ruiling Yang, Xianqi Wang, Tianyi Yan, Jiawei Zhou, Lei Zhang, Jingyang Zhao, Xi Zhou, Chitian Sun, Chenming Wu, Jiong Deng, Hongwei Xie, Ming Lu, Kun Ma, Long Chen, Guang Chen, Hangjun Ye, Bing Wang, Haiyang Sun

机构 * Xiaomi(小米)

专题命中 自动驾驶 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 提出一个统一技术系统,通过稀疏场景查询驱动的重建模块WorldRec和两阶段训练框架WorldGen,实现高保真3D场景表示与高质量因果视频生成,并联合优化以提升生成稳定性、跨帧一致性和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27418 2026-05-28 cs.MA cs.RO 64%

Differentiable Model Predictive Safety for Heterogeneous Mobility at Urban Intersections

城市交叉口异构移动体的可微分模型预测安全

Wenzhe Song, Hao Zhang

机构 * School of Business(商学院) Department of Mechanical Engineering(机械工程系) Stevens Institute of Technology(史蒂文斯理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 自动驾驶 :latent dynamics(abstract);分类 cs.RO、cs.MA;dynamics model(abstract);predictive model(abstract)

AI总结 提出可微分模型预测安全(DMPS)框架,将模型预测控制的前瞻性嵌入数据驱动的端到端强化学习架构,通过可微分安全评价器实现精确在线安全校正,在高密度混合交通仿真中将碰撞率降至5.6%以下。

Comments 6 pages. Published in IEEE IARCE 2025

Journal ref 2025 IEEE 5th International Conference on Industrial Automation, Robotics and Control Engineering (IARCE), Chongqing, China, 2025, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模型式强化学习 1 篇

2602.12468 2026-05-28 cs.LG cs.FL 50%

Continuous Diffusion Models Can Obey Formal Syntax

连续扩散模型可以遵守形式语法

Jinwoo Kim, Taylor Berg-Kirkpatrick, Loris D'Antoni

机构 * Department of Computer Science and Engineering, University of California-San Diego, San Diego, USA(计算机科学与工程系,加州大学圣地亚哥分校,圣地亚哥,美国)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 提出一种无需训练的引导方法,利用正则表达式约束连续扩散语言模型的生成过程,使其满足形式语法,并在JSON和自然语言基准上实现68-96%的约束满足率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真与规划 2 篇

2605.28810 2026-05-28 cs.LG cs.IR cs.SD 88%

Affective Music Recommendation: A Rollout-Based World Model for Offline Preference Optimization

情感音乐推荐:基于展开世界模型的离线偏好优化

Audrey Chan, Aaron Labbé, Jacob Lavoie, Jordan Bannister, Arsène Fansi Tchango, Guillaume Lajoie, Laurent Charlin

机构 * LUCID Inc. Toronto Canada LUCID Inc. Montr\' e al Canada Mila --- Qu\' e bec AI Institute Montr\' e al Canada LUCID Inc. Mila --- Qu\' e bec AI Institute

专题命中 仿真与规划 :world model(title,abstract);world model(title,abstract);分类 cs.LG

AI总结 针对在线情感实验受伦理限制的问题,提出基于展开世界模型的情感音乐推荐系统AMRS,利用因果Transformer预测用户情感状态,并通过离线偏好优化提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16030 2026-05-28 cs.LG cs.RO 76%

Mind Dreamer: Untethering Imagination via Active Causal Intervention on Latent Manifolds

Mind Dreamer: 通过潜在流形上的主动因果干预释放想象力

Shaojun Xu, Xiaoling Zhou, Yihan Lin, Yapeng Meng, Xinglong Ji, Luping Shi, Rong Zhao

机构 * Center for Brain-Inspired Computing Research, Department of Precision Instrument, Tsinghua University, Beijing, China(脑启发计算研究中心,精密仪器系,清华大学,北京,中国) College of Computer Science and Technology, Zhejiang University, Hangzhou, China(计算机科学与技术学院,浙江大学,杭州,中国) Pen-Tung Sah Institute of Micro-Nano Science and Technology, Xiamen University, Xiamen, China(彭途萨微纳米科学与技术研究院,厦门大学,厦门,中国)

专题命中 仿真与规划 :world model(abstract);world model(abstract);model-based reinforcement learning(abstract);分类 cs.LG、cs.RO

AI总结 针对基于模型的强化学习中历史束缚导致策略优化滞后的问题,提出Mind Dreamer框架,通过主动因果干预生成非连续潜在跳跃,并推导中继价值函数与中继不确定性函数,实现样本效率提升。

Comments 34 pages, 7 figures, ICML 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏