arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-05-14 至 2026-05-14 共收录 14 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 9 篇

2605.13740 2026-05-14 cs.LG 94%

Learning POMDP World Models from Observations with Language-Model Priors

从观测中学习POMDP世界模型:利用语言模型先验

Valentin Six, Frederik Panse, Mathis Fajeau, Lancelot Da Costa, Mridul Sharma, Alfonso Amayuelas, Tim Z. Xiao, David Hyland, Philipp Hennig, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) IRIIS University of California, Santa Barbara(加州大学圣芭芭拉分校) University of Tübingen(图宾根大学) University of Oxford(牛津大学) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出Pinductor,利用语言模型先验从少量观测-动作轨迹学习POMDP模型,实现高效世界模型学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19538 2026-05-14 cs.LG cs.AI 94%

DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions

DAWM:基于扩散的世界模型用于通过动作推断的离线强化学习

Zongyue Li, Xiao Han, Yusong Li, Niklas Strauss, Matthias Schubert

机构 * Department of Computer Science, University of Munich, Munich, Germany(慕尼黑大学计算机科学系) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML))

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 DAWM通过动作推断生成未来状态-奖励轨迹,结合逆动力学模型,为离线强化学习提供高效训练方案,提升算法性能。

Comments ICML2025 workshop Building Physically Plausible World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08411 2026-05-14 cs.AI cs.RO 94%

Prismatic World Model: Learning Compositional Dynamics for Planning in Hybrid Systems

棱柱世界模型:学习组合动力学以在混合系统中规划

Mingwei Li, Xiaoyuan Zhang, Chengwei Yang, Zilong Zheng, Yaodong Yang

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) NLCo Lab, Beijing Institute for General Artificial Intelligence(北大师范学院实验室,北京人工智能研究院)

专题命中 通用世界模型 :world model(title,summary_cn);world model(title,summary_cn);world models(abstract);world models(abstract)

AI总结 本文提出Prismatic World Model,通过分解混合动力学为可组合的原始构件,解决机器人领域中基于模型的规划问题,提升轨迹优化算法的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13013 2026-05-14 cs.LG 93%

JEDI: Joint Embedding Diffusion World Model for Online Model-Based Reinforcement Learning

JEDI: 联合嵌入扩散世界模型用于在线基于模型的强化学习

Jing Yu Lim, Rushi Shah, Zarif Ikram, Samson Yu, Haozhe Ma, Tze-Yun Leong, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);model-based reinforcement learning(title,abstract);world models(abstract)

AI总结 JEDI通过联合嵌入扩散方法,构建了首个端到端的潜在扩散世界模型,提升了在线基于模型的强化学习效率与性能,减少了显存占用并加快了训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08944 2026-05-14 cs.LG cs.MA 82%

Multi-Agent Decision-Focused Learning via Value-Aware Sequential Communication

多智能体决策导向学习 via 值感知序列通信

Benjamin Amoh, Geoffrey Parker, Wesley Marrero

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯大学泰勒工程学院)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出SeqComm-DFL方法,通过值感知序列通信与决策导向学习结合,提升多智能体任务性能。方法引入序列Stackelberg条件生成消息,利用信息论界限证明收敛性,并在协作医疗和StarCraft多智能体挑战中取得显著奖励和胜率提升。

Comments 9 pages, 2 figues, 1 table, neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12835 2026-05-14 cs.AI 81%

PROMETHEUS: Automating Deep Causal Research Integrating Text, Data and Models

PROMETHEUS:整合文本、数据和模型的深度因果研究自动化

Sridhar Mahadevan

机构 * Adobe Research and University of Massachusetts, Amherst(Adobe研究院和马萨诸塞大学阿默斯特分校)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 PROMETHEUS通过整合文本、数据和模型构建因果地图,利用局部因果预测状态模型和区域限制图分析研究领域内的因果关系与证据矛盾。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04759 2026-05-14 cs.CL cs.AI cs.ET cs.LG 71%

Gyan: An Explainable Neuro-Symbolic Language Model

Gyan:一种可解释的神经符号语言模型

Venkat Srinivasan, Vishaal Jatav, Anushka Chandrababu, Geetika Sharma

机构 * Innospark Ventures & Gyan AI(Innospark Ventures及Gyan AI) Gyan AI Inc.(Gyan AI公司)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 Gyan基于非Transformer架构构建,克服了传统大语言模型的局限性,在多个数据集上取得SOTA表现,展示了可信任且可靠的使命关键任务模型潜力。

Comments also submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17104 2026-05-14 cs.DC cs.AI cs.LG 71%

TStore: Rethinking AI Model Hub with Tensor-Centric Compression

TStore: 以张量为中心的AI模型仓库重新思考

Tingfeng Lan, Zirui Wang, Yunjia Zheng, Zhaoyuan Su, Juncheng Yang, Yue Cheng

机构 * University of Virginia(弗吉尼亚大学) Harvard University(哈佛大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 TStore通过细粒度去重和压缩技术减少存储开销,保留模型可用性和性能,实现实验中显著的存储节省。

Comments 12 pages, 6 figures. Systems paper on AI model storage

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13568 2026-05-14 cs.LG cs.AI 53%

Dynamical Predictive Modelling of Cardiovascular Disease Progression Post-Myocardial Infarction via ECG-Trained Artificial Intelligence Model

心肌梗死后心血管疾病进展的动态预测建模:基于ECG训练的人工智能模型

Riccardo Cavarra, Lupo Lovatelli, Shaheim Ogbomo-Harmitt, Shahid Aziz, Adelaide De Vecchi, Andrew King, Oleg Aslanidi

机构 * King’s College London(伦敦国王学院) St Thomas’ Hospital(圣 Thomas 医院) North Bristol NHS Trust(北布里斯托尔国家健康服务信托)

专题命中 通用世界模型 :predictive model(title);分类 cs.AI、cs.LG

AI总结 本文提出结合对比学习与监督多任务头的预训练模型,用于预测心肌梗死后心血管疾病进展,证明在数据有限时,临床结构化ECG建模能提升分类性能。

Comments submitted to the 9th International Conference on Computational and Mathematical Biomedical Engineering, 4 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 1 篇

2304.11193 2026-05-14 cs.RO cs.AI cs.CV 89%

Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy

多模态世界模型用于物理机器人交互:同时进行视觉和触觉预测以提高准确性

Willow Mandil, Amir Ghalamzan-E

机构 * University of Lincoln(林肯大学) University of Sheffield(谢菲尔德大学)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV、cs.RO

AI总结 本文提出多模态世界模型,通过整合视觉和触觉信息提升机器人物理交互的预测精度,特别是在物理模糊场景中表现更优。

Comments This paper is accepted for publication in Robotics and Autonomous Systems

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 自动驾驶 1 篇

2605.10426 2026-05-14 cs.CV cs.AI 85%

CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving

CoWorld-VLA:面向自动驾驶的多专家世界模型中的思考

Minqing Huang, Yujiao Xiang, Zihan Liang, Jiajie Huang, Jingqi Wang, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang, Gong Che

机构 * Afari Intelligent Drive(Afari智能驾驶公司) University of Electronic Science and Technology of China(电子科技大学) Shanghai Jiao Tong University(上海交通大学) Beijing University Of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学)

专题命中 自动驾驶 :world model(title);world model(title);分类 cs.AI、cs.CV

AI总结 本文提出CoWorld-VLA,通过多专家世界推理框架,利用显式条件指导动作规划,提升自动驾驶的场景生成与路径规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模型式强化学习 3 篇

2605.13761 2026-05-14 cs.LG cs.CE 74%

Toward AI-Driven Digital Twins for Metropolitan Floods: A Conditional Latent Dynamics Network Surrogate of the Shallow Water Equations

迈向AI驱动的数字孪生用于城市洪水:一个基于条件潜在动态网络的浅水方程代理模型

Phillip Si, Yuan Qiu, Omar Sallam, Jeremy Feinstein, Ziang He, Eugene Yan, Peng Chen

机构 * School of Computational Science and Engineering, Georgia Institute of Technology(计算科学与工程学院,佐治亚理工学院) Environmental Science Division, Argonne National Laboratory(环境科学部,阿贡国家实验室)

专题命中 模型式强化学习 :latent dynamics(title,abstract);分类 cs.LG

AI总结 本文提出CLDNet,一种基于降雨的低维潜在神经ODE模型,结合坐标解码器,用于快速模拟城市洪水。该方法在单节点上实现大规模训练,并在不需栅格化的情况下进行精确查询,显著提升预测速度和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23597 2026-05-14 cs.LG cs.AI 56%

Characteristic Root Analysis and Regularization for Linear Time Series Forecasting

特征根分析与线性时间序列预测中的正则化

Zheng Wang, Kaixuan Zhang, Wanfang Chen, Xiaonan Lu, Longyuan Li, Tobias Schlagenhauf

机构 * Bosch Center for AI (BCAI) & Bosch (China) Investment Co., Ltd.(博世人工智能中心(BCAI)及博世(中国)投资有限公司) Robert Bosch GmbH(罗伯特·博世有限公司)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 本文研究线性模型在时间序列预测中的特征根作用,提出鲁棒根重构策略,通过实验验证了其有效性,实现了高性能的预测模型。

Comments Accepted for publication at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26070 2026-05-14 cs.LG math.OC math.ST q-bio.QM stat.TH 50%

Observable Neural ODEs for Identifiable Causal Forecasting in Continuous Time

可观测的神经ODEs用于连续时间中可识别的因果预测

Jennifer Wendland, Nicolas Freitag, Maik Kschischo

机构 * Department of Computer Science(计算机科学系)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 本文提出可观测的神经ODEs模型,通过连续时间调整公式实现因果可识别,利用观测数据预测不同治疗路径的结果,实验显示在合成癌症数据、半合成数据和真实脓毒症数据上表现优异。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏