arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-03-26 至 2026-03-26 共收录 7 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 3 篇

2510.02315 2026-03-26 cs.CV 84%

FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation

FOCUS:多实体世界建模中的最优控制

Eric Tillmann Bill, Enis Simsar, Thomas Hofmann

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 通用世界模型 :world model(title);world model(title);分类 cs.CV

AI总结 本文提出FOCUS框架,通过将流匹配转化为随机最优控制,解决文本生成图像中多实体场景的属性泄露和身份纠缠问题,提出两种算法提升多实体对齐性能。

Comments Project Page: https://ericbill21.github.io/FOCUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24440 2026-03-26 cs.LG cs.AI cs.CV 83%

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

CUA-Suite:大规模人工标注的视频演示用于计算机使用代理

Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li, Patrice Bechard, Spandana Gella, Sai Rajeswar

机构 * ServiceNow University of Waterloo(多伦多大学) Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。

Comments Project Page: https://cua-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24541 2026-03-26 cs.CV cs.AI 82%

SEGAR: Selective Enhancement for Generative Augmented Reality

SEGAR:生成增强现实的定向增强

Fanjun Bu, Chenyang Yuan, Hiroshi Yasuda

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) Toyota Research Institute(电装研究院)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 SEGAR结合扩散世界模型与定向修正阶段,实现生成增强现实中的区域特定编辑与安全区域对齐,为未来帧的生成、缓存和定向修正提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 2 篇

2603.18336 2026-03-26 cs.RO 82%

ManiDreams: An Open-Source Library for Robust Object Manipulation via Uncertainty-aware Task-specific Intuitive Physics

ManiDreams:一种基于不确定性强鲁棒物体操作的开源库

Gaotian Wang, Kejia Ren, Andrew S. Morgan, Kaiyu Hang

机构 * Department of Computer Science, Rice University, Houston, TX 77005, USA(计算机科学系,里士大学,德克萨斯州休斯敦,77005,美国) Robotics and AI Institute, Cambridge, MA 02142, USA(机器人与人工智能研究所,马萨诸塞州剑桥,02142,美国)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 ManiDreams通过整合不确定性表示、传播和约束,提升机器人操作的鲁棒性,实验表明其在多种扰动下表现优于传统RL方法。

Comments 9 pages, 10 figures. Project page at https://rice-robotpi-lab.github.io/ManiDreams/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13528 2026-03-26 cs.RO cs.CV 71%

Learning Actionable Manipulation Recovery via Counterfactual Failure Synthesis

通过反事实失败合成学习可操作的操纵恢复

Dayou Li, Jiuzhou Lei, Hao Wang, Lulin Liu, Yunhao Yang, Zihan Wang, Bangya Liu, Minghui Zheng, Zhiwen Fan

机构 * Texas A&M University(德克萨斯A&M大学) University of Minnesota(明尼苏达大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Abaka AI(Abaka人工智能) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 本文提出Dream2Fix框架,通过生成反事实失败场景数据提升机器人故障恢复能力,实现高精度的故障诊断与轨迹修正。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 自动驾驶 1 篇

2603.24581 2026-03-26 cs.CV cs.RO 82%

Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving

潜在世界动作建模:端到端自动驾驶的潜在世界建模

Linbo Wang, Yupeng Zheng, Qiang Chen, Shiwei Li, Yichen Zhang, Zebin Xing, Qichao Zhang, Xiang Li, Deheng Qian, Pengxuan Yang, Yihang Dong, Ce Hao, Xiaoqing Ye, Junyu han, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) College of AI, Tsinghua University(清华大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 自动驾驶 :world model(abstract);world-model(abstract);world model(abstract);world-model(abstract)

AI总结 本文提出Latent-WAM框架,通过空间感知和动态感知的潜在世界表示实现高效端到端自动驾驶,实验显示在NAVSIM v2和HUGSIM上取得新的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仿真与规划 1 篇

2603.23874 2026-03-26 cs.CV 53%

EnvSocial-Diff: A Diffusion-Based Crowd Simulation Model with Environmental Conditioning and Individual-Group Interaction

EnvSocial-Diff: 一种基于扩散的群体模拟模型,包含环境条件和个体-群体交互

Bingxue Zhao, Qi Zhang, Hui Huang

机构 * VCC, College of Computer Science and Software Engineering, Shenzhen University(VCC,计算机科学与软件工程学院,深圳大学)

专题命中 仿真与规划 :simulation model(title,abstract);分类 cs.CV

AI总结 本文提出EnvSocial-Diff模型,结合社会物理和环境条件,通过环境编码模块和个体-群体交互模块提升群体模拟的现实性,实验表明其优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏