arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-05-25 至 2026-05-25 共收录 14 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 7 篇

2605.23220 2026-05-25 cs.LG 92%

WMAttack: Automated Attack Search for Adversarial Evaluation of World-Model Agents

WMAttack:世界模型智能体对抗评估的自动化攻击搜索

Zhixiang Guo, Siyuan Liang, Shi Fu, Cheng Guo, Andras Balogh, Mark Jelasity, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) University of Szeged(塞格德大学)

专题命中 通用世界模型 :world-model(title,abstract);world-model(title,abstract);world model(abstract);world models(abstract)

AI总结 提出WMAttack框架,通过自校正攻击搜索和表征引导攻击检索,自动搜索攻击配置以高效评估世界模型智能体的对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11596 2026-05-25 cs.CV 92%

HorizonDrive: Self-Corrective Autoregressive World Model for Long-horizon Driving Simulation

HorizonDrive: 用于长时域驾驶仿真的自纠正自回归世界模型

Conglang Zhang, Yifan Zhan, Qingjie Wang, Zhanpeng Ouyang, Yu Li, Zihao Yang, Xiaoyang Guo, Weiqiang Ren, Qian Zhang, Zhen Dong, Yinqiang Zheng, Wei Yin, Zhengqing Chen

机构 * Wuhan University(武汉大学) The University of Tokyo(东京大学) Horizon Robotics Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);driving world model(abstract)

AI总结 针对自回归驾驶仿真中教师模型因自身预测漂移导致监督退化的问题,提出HorizonDrive框架,通过计划性滚转恢复(SRR)训练抗漂移教师模型,并利用教师滚转分布匹配蒸馏(TRD)实现长时域监督下的高效学生模型部署。

Comments Comments: 22 pages, 14 figures. Project page: https://zcliangyue.github.io/HorizonDrive Code: https://github.com/zcliangyue/HorizonDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10347 2026-05-25 cs.AI cs.CL 92%

How Mobile World Model Guides GUI Agents?

移动世界模型如何指导GUI代理?

Weikai Xu, Kun Huang, Yunren Feng, Jiaxing Li, Yuhan Chen, Yuxuan Liu, Zhizheng Jiang, Heng Qu, Pengzhi Gao, Wei Liu, Jian Luan, Xiaolin Hu, Bo An

机构 * Nanyang Technological University(南洋理工大学) MiLM Plus, Xiaomi Inc.(小米公司) Independent Researchers(独立研究人员) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Wuhan University(武汉大学) Xiamen University(厦门大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world-model(abstract)

AI总结 本文通过训练四种模态(增量文本、完整文本、扩散图像、可渲染代码)的世界模型,并评估其在下游任务中的效用,发现可渲染代码重建在分布内保真度高,文本反馈对在线分布外执行更鲁棒,世界模型生成的轨迹可提供迁移经验但无法替代原始分布,且对低熵过度自信的代理,后验自省收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23025 2026-05-25 cs.LG 90%

World Machine: Towards Generative World Modeling for Time-Series

世界机器:面向时间序列的生成式世界建模

Elton Cardoso do Nascimento, Alexandre da Silva Simões, Esther Luna Colombini, Ricardo Ribeiro Gudwin, Paula Dornhofer Paro Costa

机构 * Universidade Estadual de Campinas (UNICAMP)(坎皮纳斯州立大学) Universidade Estadual Paulista (UNESP)(保罗斯州立大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 提出基于Transformer的潜在状态架构World Machine,用于时间序列生成式世界建模,在合成数据集Toy1D上验证了其超越传统Transformer的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23699 2026-05-25 cs.CV 81%

CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models

CRONOS:视频模型中反事实物理一致性的基准测试

León Begiristain, Olaf Dünkel, Adam Kortylewski

机构 * University of Freiburg(弗莱堡大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) CISPA Helmholtz Center for Information Security(哈勒斯海姆信息安全中心)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出CRONOS基准,通过干预视角、场景、物体类别和外观四个因素,评估视频模型在固定物理事件类型下反事实物理一致性的表现,发现现有模型存在显著失败。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03421 2026-05-25 astro-ph.EP nlin.AO physics.bio-ph physics.pop-ph q-bio.PE 67%

Exo-Daisy World: Revisiting Gaia Theory through an Informational Architecture Perspective

Exo-Daisy World: 通过信息架构视角重新审视盖亚理论

Damian R Sowinski, Gourab Ghoshal, Adam Frank

专题命中 通用世界模型 :world model(abstract);world model(abstract)

AI总结 本研究通过语义信息理论扩展经典Daisy World模型,分析生物圈与行星环境之间的信息流,提出Exo-Daisy World模型并揭示相关性随恒星亮度增强的规律,为天体生物学观测和不可知生物特征识别提供新方法。

Comments 14 pages, 4 figures, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14083 2026-05-25 cs.LG cs.AI 50%

GeoMAE: Masking Representation Learning for Spatio-Temporal Graph Forecasting with Missing Values

GeoMAE:面向缺失值的时空图预测的掩码表示学习

Songyu Ke, Chenyu Wu, Yuxuan Liang, Huiling Qin, Junbo Zhang, Yu Zheng

机构 * College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) JD Intelligent Cities Research(京东智能城市研究院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Normal University(北京师范大学)

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 提出GeoMAE自监督模型,通过输入预处理、注意力时空预测网络和掩码自编码器辅助任务,解决缺失数据下的时空图预测问题,在真实数据集上相对最优基线提升13.20%。

Comments 34 pages for pre-print version. This work has been published in *Neural Networks*. Please check the latest version via the following DOI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 1 篇

2506.14135 2026-05-25 cs.RO cs.CV 85%

GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation

GAF: 高斯动作场作为机器人操作中动态世界建模的4D表示

Ying Chai, Litao Deng, Ruizhi Shao, Jiajun Zhang, Kangchen Lv, Liangjun Xing, Xiang Li, Hongwen Zhang, Yebin Liu

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) Shadow AI

专题命中 具身与机器人 :world model(title);world model(title);分类 cs.CV、cs.RO

AI总结 提出GAF,通过扩展3D高斯溅射引入可学习运动属性,实现动态场景的4D建模,并利用动作-视觉对齐去噪框架提升机器人操作成功率。

Comments https://ChaiYing1.github.io/projects/GAF/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 自动驾驶 1 篇

2605.21139 2026-05-25 cs.CV cs.LG 71%

Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving

蒸馏思考,预见行动:面向自动驾驶的认知-物理强化学习

Yang Wu, Qiang Meng, Zhaojiang Liu, Youquan Liu, Jian Yang, Jin Xie

机构 * NJU(南京大学) SJTU(上海交通大学) FDU(福建大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV

AI总结 提出CoPhy框架,通过蒸馏VLM知识到BEV编码器实现零推理成本的认知能力,并构建自回归BEV世界模型预测未来语义地图以提供可解释的物理沙盒,结合双奖励机制(物理奖励和安全约束、认知奖励和意图对齐)优化驾驶策略,在NAVSIM基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模型式强化学习 5 篇

2605.23089 2026-05-25 cs.LG cs.AI 89%

Dreaming Smoothly and Sample Efficiently with Gradient Penalized Latent Dynamics

利用梯度惩罚潜在动力学实现平滑且高效的采样

Romil V. Sonigra, P. R. Kumar

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Texas A&M University(德克萨斯大学)

专题命中 模型式强化学习 :latent dynamics(title,abstract);world model(abstract);world models(abstract);world model(abstract)

AI总结 提出GPLD正则化器,通过行雅可比惩罚增强DreamerV3潜在转移动力学的局部平滑性,提升样本效率,尤其在复杂运动控制任务中表现显著。

Comments 17 pages and 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23845 2026-05-25 cs.CV 84%

Learning a Particle Dynamics Model with Real-world Videos

利用真实世界视频学习粒子动力学模型

Chanho Kim, Suhas V. Sumukh, Li Fuxin

机构 * Oregon State University(俄勒冈州立大学)

专题命中 模型式强化学习 :world model(abstract);world models(abstract);dynamics model(title,abstract);world model(abstract)

AI总结 提出一种从无标签真实视频直接训练神经物体动力学模型的框架,结合高斯溅射技术,通过渲染监督学习粒子位置和旋转变化,避免对合成数据的依赖。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21306 2026-05-25 cs.LG cs.AI 79%

The Surprising Difficulty of Search in Model-Based Reinforcement Learning

基于模型的强化学习中搜索的惊人困难

Wei-Di Chang, Mikael Henaff, Brandon Amos, Gregory Dudek, Scott Fujimoto

机构 * Meta FAIR McGill University(麦吉尔大学)

专题命中 模型式强化学习 :model-based reinforcement learning(title,abstract);model-based RL(abstract);分类 cs.AI、cs.LG

AI总结 本文研究基于模型的强化学习中的搜索问题,发现即使模型高度准确,搜索也可能损害性能,而缓解过估计偏差比提高模型或价值函数精度更重要,通过取价值函数集成的最小值可有效解决偏差并实现有效搜索。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23470 2026-05-25 cs.LG cs.AI cs.CE 56%

Learning Individual Dynamics from Sparse Cross-Sectional Snapshots

从稀疏横截面快照中学习个体动力学

Christian Lagemann, Kai Lagemann, Steven L. Brunton, Sach Mukherjee

机构 * Statistics and Machine Learning, German Center for Neurodegenerative Diseases (DZNE)(统计与机器学习,德国神经退行性疾病中心(DZNE)) MediaTek Research(联发科技研究) Department of Mechanical Engineering & AI Institute in Dynamic Systems, University of Washington, Seattle(机械工程与人工智能动态系统研究所,华盛顿大学,西雅图) DZNE & University of Bonn, Bonn, Germany and University of Cambridge, Cambridge, United Kingdom(DZNE与波恩大学,波恩,德国和剑桥大学,剑桥,英国)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 提出CADENCE框架,通过将潜在动力学锚定到静态个体上下文,从孤立快照中恢复连续个体轨迹,并证明单时间点轨迹推断的可识别性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23510 2026-05-25 cs.LG 50%

Learning partially observed systems with neural Hamiltonian ordinary differential equations

学习部分观测系统:神经哈密顿常微分方程

Sunniva Meltzer, Sølve Eidnes, Alexander Johannes Stasik

机构 * Department of Mathematics and Cybernetics, SINTEF Digital(数学与自动化系,SINTEF数字研究院) Department of Physics, University of Oslo(物理系,奥斯陆大学) Department of Data Science, Norwegian University of Life Science(数据科学系,挪威生命科学大学)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 提出神经哈密顿常微分方程(NHODE)框架,结合哈密顿神经网络和神经常微分方程,从部分观测数据中学习物理系统,通过嵌入哈密顿结构保证能量守恒,并仅在观测变量上定义损失,在多个复杂系统上验证了其预测精度和长期稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏