arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-05-11 至 2026-05-11 共收录 23 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 16 篇

2605.07278 2026-05-11 cs.LG cs.AI cs.CV 94%

Predictive but Not Plannable: RC-aux for Latent World Models

可预测但不可计划:RC-aux用于潜在世界模型

Wenyuan Li, Guang Li, Keisuke Maeda, Takahiro Ogawa, Miki Haseyama

机构 * Hokkaido University(北海道大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出RC-aux,通过改进潜在世界模型的时空匹配,提升规划能力,实验表明其在目标导向任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06298 2026-05-11 cs.CV cs.AI 94%

Render, Don't Decode: Weight-Space World Models with Latent Structural Disentanglement

渲染,而非解码:具有潜在结构解耦的权重空间世界模型

Roussel Desmond Nzoyem, Mauro Comi

机构 * Department of Computer Science(计算机科学系) University of Manchester(曼彻斯特大学) University of Bristol(布里斯托大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出NOVA框架,通过权重和偏置构建隐式神经表示,实现高效且可解释的世界模型,支持结构场景组件的解耦与编辑。

Comments 35 pages, 30 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07079 2026-05-11 cs.CV cs.AI cs.LG cs.RO 94%

Learning Visual Feature-Based World Models via Residual Latent Action

通过残差潜在动作学习基于视觉特征的世界模型

Xinyu Zhang, Zhengtong Xu, Yutian Tao, Yeping Wang, Yu She, Abdeslam Boularias

机构 * Rutgers University(罗格斯大学) Purdue University(普渡大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出RLA-WM世界模型,通过流匹配预测残差潜在动作,优于现有特征和视频扩散模型,且在速度和效率上更优,同时开发了两项机器人学习技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07288 2026-05-11 cs.CV cs.AI 94%

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

Sword: 通过动态潜在自举实现风格鲁棒的世界模型作为模拟器用于VLA策略后训练

Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Swinburne University of Technology(西敏大学) JDT AI Infra(JDT AI基础设施)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出Sword框架,通过结构引导的风格增强和动态潜在自举提升VLA模型在特定环境中的泛化能力、生成质量和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06841 2026-05-11 cs.AI cs.LG 94%

AGWM: Affordance-Grounded World Models for Environments with Compositional Prerequisites

AGWM:基于 affordance 的世界模型用于具有组合前提条件的环境

Qinshi Zhang, Weipeng Deng, Zhihan Jiang, Jiaming Qu, Qianren Li, Weitao Xu, Ray LC

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Hong Kong(香港大学) Columbia University(哥伦比亚大学) Amazon(亚马逊) City University of Hong Kong(香港城市大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出 AGWM 模型,通过学习抽象 affordance 结构来跟踪动作的动态可执行性,以解决传统世界模型在多步预测中的误差累积问题。

Comments 16 pages, 3 figures, 4 tables. Appendix on pages 11-16 (main text is self-contained)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22976 2026-05-11 cs.CV cs.AI 94%

LoopNav: Benchmarking Spatial Consistency in World Models

LoopNav:世界模型中空间一致性评估的基准测试

Kewei Lian, Shaofei Cai, Yitao Liang, Anji Liu

机构 * NUS(国立新加坡大学) Peking Univeristy(北京大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 LoopNav提出一个基于循环导航的基准测试,用于评估世界模型的空间一致性,通过Minecraft开放世界环境收集250小时视频数据,并引入场景图一致性评分以量化空间一致性。

Comments V3: SGCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19788 2026-05-11 cs.AI cs.LG 92%

Benchmarking World-Model Learning with Environment-Level Queries

用环境级查询评估世界模型学习

Archana Warrier, Dat Nguyen, Michelangelo Naim, Moksh Jain, Yichao Liang, Karen Schroeder, Cambridge Yang, Joshua B. Tenenbaum, Sebastian Vollmer, Kevin Ellis, Zenna Tavares

机构 * Basis Research Institute DFKI GmbH Harvard University Universit\'e de Montr\'eal \& Mila - Quebec AI Institute University of Cambridge Massachusetts Institute of Technology Cornell University

专题命中 通用世界模型 :world-model(title,abstract);world-model(title,abstract);world model(abstract);world models(abstract)

AI总结 本文提出WorldTest协议,通过环境级查询评估智能体是否学习到支持多种环境属性的模型,通过AutumnBench验证人类在网格世界环境中的表现优于前沿模型。

Comments 34 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07326 2026-05-11 cs.CV 90%

GEM: Generating LiDAR World Model via Deformable Mamba

GEM: 通过可变形Mamba生成LiDAR世界模型

Yang Wu, Zhaojiang Liu, Qiang Meng, Youquan Liu, Renliang Weng, Jianjun Qian, Jian Yang, Jin Xie

机构 * NJU(南京大学) SJTU(上海交通大学) FDU(福建师范大学) NTU(南京理工大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 GEM通过可变形Mamba架构提升LiDAR世界模型的逼真度与想象力,解决点云无序和动态静态区分难题,实现空间时间感知与自主探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07199 2026-05-11 cs.AI cs.LG 88%

Three-in-One World Model: Energy-Based Consistency, Prediction, and Counterfactual Inference for Marketing Intervention

三位一体世界模型:用于营销干预的能量一致性、预测和反事实推断

Junichiro Niimi

机构 * Meijo University(名古屋大学)

专题命中 通用世界模型 :world model(title);world model(title);world-model(abstract);world-model(abstract)

AI总结 本文提出三位一体世界模型,利用深度玻尔兹曼机学习消费者特征,通过轻量任务适配器实现一致性评估、预测和反事实推断,展示其在营销干预中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00932 2026-05-11 cs.SE cs.AI 88%

Code World Model Preparedness Report

代码世界模型准备性报告

Daniel Song, Peter Ney, Cristina Menghini, Faizan Ahmad, Aidan Boyd, Nathaniel Li, Ziwen Han, Jean-Christophe Testud, Saisuke Okabayashi, Maeve Ryan, Jinpeng Miao, Hamza Kwisaba, Felix Binder, Spencer Whitman, Jim Gust, Esteban Arcaute, Dhaval Kapil, Jacob Kahn, Ayaz Minhas, Tristan Goodman, Lauren Deason, Alexander Vaughan, Shengjia Zhao, Summer Yue

机构 * MSL Preparedness Team(MSL准备团队) AI Security Team(AI安全团队)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 报告评估了Meta的代码世界模型在潜在灾难性风险领域的准备情况,发现其风险与现有AI生态无异,因此作为开源模型发布。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11758 2026-05-11 cs.RO 88%

HAIC: Humanoid Agile Object Interaction Control via Dynamics-Aware World Model

HAIC:通过动态感知世界模型实现人形敏捷物体交互控制

Dongting Li, Xingyu Chen, Qianyang Wu, Bo Chen, Sikai Wu, Hanyu Wu, Guoyao Zhang, Liang Li, Mingliang Zhou, Diyun Xiang, Jianzhu Ma, Qiang Zhang, Renjing Xu

机构 * Tsinghua University(清华大学) HKUST(Guangzhou)(香港科技大学(广州)) ETH Zurich(苏黎世联邦理工学院) Xiaomi Robotics Lab(小米机器人实验室)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 本文提出HAIC框架,通过动态预测和空间优先级构建动态占用地图,实现人形机器人在复杂动态环境下与不同物体的稳健交互,提升敏捷任务和多物体长周期任务的完成能力。

Comments RSS 2026. Webpage: https://haic-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07390 2026-05-11 cs.CV 88%

ST-Gen4D: Embedding 4D Spatiotemporal Cognition into World Model for 4D Generation

ST-Gen4D:将4D时空认知嵌入世界模型以实现4D生成

Haonan Wang, Hanyu Zhou, Tao Gu, Luxin Yan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 本文提出ST-Gen4D框架,通过4D时空认知世界模型实现4D生成,结合时空表示、认知、推理和生成四大设计,提升4D生成的结构合理性和拓扑一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03490 2026-05-11 cs.LG q-bio.NC 81%

Path Integration and Object-Location Binding Emerge in an Action-Conditioned Predictive Sequence Network

路径整合与物体-位置绑定在动作条件预测序列网络中出现

Linda Ariel Ventura, Victoria Bosch, Tim C Kietzmann, Sushrut Thorat

机构 * Sorbonne University(索邦大学) Institute of Cognitive Science(认知科学研究所) Osnabrück University(奥斯纳布吕克大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 研究探讨了动作条件预测序列网络如何通过上下文学习提升预测准确性,并揭示了路径整合和动态绑定在结构化表示中的作用。

Comments 8 pages, 4 figures; accepted at CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08007 2026-05-11 cs.LG 69%

Interpreting Reinforcement Learning Agents with Susceptibilities

用脆弱性解释强化学习智能体

Chris Elliott, Einar Urdshals, David Quarel, Daniel Murfet

机构 * Timaeus

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG

AI总结 本文将神经网络可解释性技术扩展到深度强化学习的后悔设定,探讨脆弱性在简单网格世界模型中的应用,揭示模型在参数空间中的内部发展特征。

Comments 55 pages, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24091 2026-05-11 cs.DC 67%

Unfolding an Atomistic World: Atomistic Simulation of Reactor Pressure Vessel Steel Across Year-and-Meter Scales

揭示原子世界:反应堆压力容器钢的原子模拟跨越年和米尺度

Haozhi Han, Ruge Zhang, Haoquan Chen, Yifeng Chen, Haipeng Jia, Liang Yuan, Yunquan Zhang, Ting Cao, Yunxin Liu, Ya-Qin Zhang, Kun Li

专题命中 通用世界模型 :world model(abstract);world model(abstract)

AI总结 本文提出AtomWorld框架,通过算法、HPC和应用三层协同,实现反应堆压力容器钢在年和米尺度的原子模拟,首次达到十夸脱原子系统的模拟规模,时间效率达1.71天/服务年。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08035 2026-05-11 eess.SP cs.LG 50%

PropSplat: Map-Free RF Field Reconstruction via 3D Gaussian Propagation Splatting

PropSplat: 通过3D高斯传播散射实现无地图的射频场重建

William Bjorndahl, Maninder Pal Singh, Farhad Nouri, Joseph Camp

机构 * Department of Electrical and Computer Engineering, Southern Methodist University, Dallas, TX, USA(电气与计算机工程系,南方 Methodist 大学,德克萨斯州达拉斯市) Department of Engineering Technology, University of Houston, Houston, TX, USA(工程技术系,德克萨斯大学休斯敦分校)

专题命中 通用世界模型 :environment model(abstract);分类 cs.LG

AI总结 PropSplat利用3D各向异性高斯体重建射频场,无需地理数据或外部信息,通过端到端优化实现精准传播建模,优于现有方法。

Comments Accepted for presentation at IEEE DySPAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 自动驾驶 2 篇

2512.03454 2026-05-11 cs.CV cs.AI 90%

Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles

在驾驶前思考:基于世界模型的多模态接地用于自动驾驶车辆

Haicheng Liao, Huanming Shen, Bonan Wang, Yongkang Li, Yihong Tang, Chengyue Wang, Dingyi Zhuang, Kehua Chen, Hai Yang, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) UESTC(电子科技大学) Purdue University(普渡大学) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 自动驾驶 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 本文提出ThinkDeeper框架,通过预测未来空间状态提升自动驾驶车辆的自然语言指令理解能力,结合超图引导解码器融合多模态输入,提出DrivePilot数据集并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07195 2026-05-11 cs.CV 81%

See Tomorrow, Act Today: Foresight-Driven Autonomous Driving

预见未来,立即行动:基于预见的自动驾驶

Bozhou Zhang, Nan Song, Yuang Wang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出ForeSight框架,通过生成未来场景并据此规划动作,实现前瞻性决策,实验表明其在动态场景中优于现有方法。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模型式强化学习 5 篇

2605.07116 2026-05-11 cs.LG cs.AI cs.NA math.NA math.OC 76%

Stabilized neural Hamilton--Jacobi--Bellman solvers: Error analysis and applications in model-based reinforcement learning

稳定神经哈密顿-雅可比-贝尔曼求解器:误差分析及在基于模型的强化学习中的应用

Minseok Kim, Yeongjong Kim, Namkyeong Cho, Yeoneung Kim

机构 * Seoul National University of Science and Technology(首尔科学技术大学) POSTECH Gachon University(成均馆大学)

专题命中 模型式强化学习 :model-based reinforcement learning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出稳定神经HJB求解器,通过混合方法分析误差并应用于强化学习,验证了求解器在模型误差和策略不匹配下的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02832 2026-05-11 cs.LG physics.flu-dyn 74%

Koopman Autoencoders with Continuous-Time Latent Dynamics for Fluid Dynamics Forecasting

具有连续时间潜在动态的Koopman自编码器用于流体动力学预测

Rares Grozavescu, Pengyu Zhang, Etienne Meunier, Mark Girolami

机构 * University of Cambridge(剑桥大学) Alan Turing Institute(艾伦·图灵研究所) Inria(法国国家信息与自动化技术研究所)

专题命中 模型式强化学习 :latent dynamics(title,abstract);分类 cs.LG

AI总结 本文提出一种连续时间Koopman自编码器,通过闭式推断实现长周期预测,克服了传统方法的固定时间步限制,并在流体动力学中实现了高效稳定预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03201 2026-05-11 cs.LG 74%

SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning

SLOPE:基于模型的强化学习中的乐观势能塑造

Yao-Hui Li, Zeyu Wang, Xin Li, Wei Pang, Yingfang Yuan, Zhengkun Chen, Boya Zhang, Riashat Islam, Alex Lamb, Yonggang Zhang

机构 * Beijing Institute of Technology(北京理工大学) Heriot-Watt University(赫瑞-沃森大学) Shenzhen Institutes of Advanced Technology, CAS(深圳先进技术研究院) Microsoft Research NY(微软研究院纽约分部) Tsinghua University(清华大学) Jilin University(吉林大学)

专题命中 模型式强化学习 :model-based reinforcement learning(title,abstract);分类 cs.LG

AI总结 SLOPE通过乐观势能估计构建信息丰富的势能景观,解决稀疏奖励环境下梯度信息不足的问题,提升模型在稀疏、半稀疏和密集奖励任务中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07218 2026-05-11 cs.LG stat.ML 68%

Improved Model-based Reinforcement Learning with Smooth Kernels

基于平滑核的改进模型基于强化学习

Kun Long, Yuqiang Li, Xianyi Wu

机构 * School of Statistics, KLATASDS-MOE(统计学学院,KLATASDS-MOE) East China Normal University(华东师范大学)

专题命中 模型式强化学习 :model-based reinforcement learning(title);分类 cs.LG

AI总结 本文提出了一种基于核平滑的模型驱动强化学习方法,利用mdp的平滑性,通过伯恩斯坦式探索奖励改进了有限时间 horizon 下的 regret 绑定。

Comments 38 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09034 2026-05-11 q-bio.NC cs.AI 50%

Latent-Space Causal Discovery from Indirect Neuroimaging Observations

从间接神经影像观测中发现潜在空间因果关系

Sangyoon Bae, Miruna Oprescu, David Keetae Park, Shinjae Yoo, Jiook Cha

机构 * Interdisciplinary Program in Artificial Intelligence(人工智能交叉学科项目) Seoul National University(首尔国立大学) Computer Science(计算机科学) Cornell Tech, Cornell University(康奈尔科技,康奈尔大学) Brookhaven National Laboratory(布鲁克海文国家实验室) Department of Psychology(心理学系)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI

AI总结 本文提出INCAMA方法,通过物理感知逆向与延迟感知Mamba编码器,提升从间接神经影像中恢复因果结构的性能,实验显示在TVB模拟和HCP任务fMRI中表现更优。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏