arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-03-23 至 2026-03-23 共收录 9 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 5 篇

2509.19080 2026-03-23 cs.RO cs.AI 94%

World4RL: Diffusion World Models for Policy Refinement with Reinforcement Learning for Robotic Manipulation

World4RL: 基于扩散世界模型的强化学习政策精修框架用于机器人操作

Zhennan Jiang, Kai Liu, Yuxin Qin, Shuai Tian, Yupeng Zheng, Mingcai Zhou, Chao Yu, Haoran Li, Dongbin Zhao

机构 * The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院) Beijing Zhongke Huiling Robot Technology Co(北京中科创联机器人技术有限公司) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 World4RL通过扩散世界模型提升机器人操作政策的精修效果,采用高保真模拟环境进行端到端政策优化,优于模仿学习及其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20048 2026-03-23 eess.SP cs.LG 94%

Structured Latent Dynamics in Wireless CSI via Homomorphic World Models

通过同态世界模型在无线CSI中实现结构化潜在动态

Salmane Naoumi, Mehdi Bennis, Marwa Chafii

机构 * Engineering Division, New York University (NYU), Abu Dhabi, UAE.(纽约大学阿布扎克分校工程系) Center for Wireless Communications, University of Oulu, Finland.(奥卢大学无线通信中心) NYU WIRELESS, NYU Tandon School of Engineering, New York, USA.(纽约大学无线技术实验室,纽约大学坦顿工程学院)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);latent dynamics(title,abstract)

AI总结 本文提出一种自监督框架,通过建模CSI的时间演变,在紧凑的潜在空间中学习无线信道的预测和结构化表示,利用JEPA学习动作条件的潜在动态,通过同态更新提升几何一致性和组合性,实验表明其在保持拓扑和预测未来嵌入方面优于基线方法。

Comments ACCEPTED FOR PUBLICATION IN IEEE INTERNATIONAL CONFERENCE ON COMMUNICATIONS (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19708 2026-03-23 cs.CV 92%

WorldAgents: Can Foundation Image Models be Agents for 3D World Models?

WorldAgents: 2D基础图像模型是否能作为3D世界模型的智能体?

Ziya Erkoç, Angela Dai, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 本文探讨2D基础图像模型是否具备3D世界生成能力,提出多智能体架构实现3D世界合成,通过实验验证2D模型能生成一致且逼真的3D世界。

Comments Webpage: https://ziyaerkoc.com/worldagents/ Video: https://www.youtube.com/watch?v=Mj2FqqhurdI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18202 2026-03-23 cs.LG cs.AI cs.RO 92%

R2-Dreamer: Redundancy-Reduced World Models without Decoders or Augmentation

R2-Dreamer:无需解码器或增强的冗余减少世界模型

Naoki Morihira, Amal Nahar, Kartik Bharadwaj, Yasuhiro Kato, Akinobu Hayashi, Tatsuya Harada

机构 * Honda R&D Co., Ltd.(本田研发株式会社) The University of Tokyo(东京大学) RIKEN AIP(日本科学技术研究院(RIKEN)先进研究所(AIP))

专题命中 通用世界模型 :world model(title);world models(title);world model(title);world models(title)

AI总结 R2-Dreamer提出一种无需解码器或增强的基于模型的强化学习框架,通过自监督目标作为内部正则化器,提高表示鲁棒性,训练速度更快且在多个任务中表现优异。

Comments 20 pages, 12 figures, 2 tables

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19675 2026-03-23 cs.CV cs.RO 90%

DynFlowDrive: Flow-Based Dynamic World Modeling for Autonomous Driving

DynFlowDrive: 基于流的动态世界建模用于自动驾驶

Xiaolu Liu, Yicong Li, Song Wang, Junbo Chen, Angela Yao, Jianke Zhu

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 本文提出DynFlowDrive,通过流基于的动力学建模提升自动驾驶中的场景预测可靠性,引入稳定性感知的多模式轨迹选择策略,实验证明在nuScenes和NavSim基准上效果显著。

Comments 18 pages, 6 figs

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 2 篇

2603.19418 2026-03-23 cs.RO cs.DC 69%

Speculative Policy Orchestration: A Latency-Resilient Framework for Cloud-Robotic Manipulation

推测性策略协调:一种低延迟的云机器人操控框架

Chanh Nguyen, Shutong Jin, Florian T. Pokorny, Erik Elmroth

机构 * Department of Computing Science, Umeå University(乌梅大学计算科学系) School of Electrical Engineering and Computer Science, KTH Royal Institute of Technology(皇家理工学院电气工程与计算机科学学院)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 本文提出SPO框架,通过预计算并流式传输未来运动学路径点,降低网络延迟对系统的影响,提升云机器人操控的实时性和安全性。

Comments 9 pages, 7 figures, conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19655 2026-03-23 cs.RO cs.SY eess.SY 50%

Accurate Open-Loop Control of a Soft Continuum Robot Through Visually Learned Latent Representations

通过视觉学习的潜在表示实现软连续机器人的准确开环控制

Henrik Krauss, Johann Licher, Naoya Takeishi, Annika Raatz, Takehisa Yairi

机构 * Department of Advanced Interdisciplinary Studies, The University of Tokyo(东京大学先进跨学科研究科) Institute of Assembly Technology and Robotics, Leibniz University Hannover(莱比锡大学装配技术与机器人研究所) Research Center for Advanced Science and Technology, The University of Tokyo(东京大学先进科学研究中心)

专题命中 具身与机器人 :latent dynamics(abstract);分类 cs.RO

AI总结 本文提出通过视觉学习的潜在动态实现软连续机器人的开环控制,利用视觉振荡网络和注意力广播解码器,减少图像空间跟踪误差,验证了可解释的视频学习潜在动态在长时间尺度开环控制中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模型式强化学习 1 篇

2512.07558 2026-03-23 cs.LG cs.CV 56%

ReLaX: Reasoning with Latent Exploration for Large Reasoning Models

ReLaX:基于潜在探索的大型推理模型推理

Shimin Zhang, Xianwei Chen, Yufan Shen, Ziyuan Ye, Jibin Wu

机构 * Hong Kong Polytechnic University(香港理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG、cs.CV

AI总结 ReLaX通过引入潜在动态分析,提升大型推理模型的探索与利用平衡,通过动态谱分散度度量潜在动态异质性,优于现有token级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仿真与规划 1 篇

2603.20169 2026-03-23 cs.CV cs.MM 81%

EgoForge: Goal-Directed Egocentric World Simulator

EgoForge:面向目标的自体世界模拟器

Yifan Shen, Jiateng Liu, Xinzhuo Li, Yuanzhe Liu, Bingxuan Li, Houze Yang, Wenqi Jia, Yijiang Li, Tianjiao Yu, James Matthew Rehg, Xu Cao, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California San Diego(加州大学圣地亚哥分校)

专题命中 仿真与规划 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 EgoForge通过最小静态输入生成连贯的第一人称视频,结合VideoDiffusionNFT提升意图对齐和时间一致性,实现在动态环境模拟中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏