arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-05-21 至 2026-05-21 共收录 12 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 10 篇

2605.12334 2026-05-21 cs.AI 93%

Reinforcing VLAs in Task-Agnostic World Models

在任务无关的世界模型中强化视觉-语言-动作

Yucen Wang, Rui Yu, Fengming Zhang, Junjie Lu, Xinyao Qin, Tianxiang Zhang, Kaixin Wang, Li Zhao

机构 * Microsoft Research Asia(微软亚洲研究院) Nanjing University(南京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Wuhan University(武汉大学) University of Technology Sydney(悉尼科技大学) Tsinghua University(清华大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出RAW-Dream方法,通过分离世界模型学习与下游任务依赖,利用预训练的世界模型和现成的视觉-语言模型,实现零样本推理,从而在无需任务特定数据的情况下提高VLA适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22430 2026-05-21 cs.LG 93%

Inference Time Policy Optimization for Offline RL with Differentiable World Models

基于可微世界模型的离线强化学习推理时间策略优化

Rohan Deb, Stephen J. Wright, Arindam Banerjee

机构 * Siebel School of Computing and Data Science(计算与数据科学学院) Department of Computer Sciences(计算机科学系) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin Madison(威斯康星大学麦迪逊分校)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(title);world models(title)

AI总结 本文提出了一种在推理时间利用可微世界模型优化策略参数的方法,通过端到端的梯度计算提升离线强化学习的性能,同时探讨了推理时间适应的计算开销与收益的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09586 2026-05-21 cs.CV cs.RO 90%

DeformMaster: An Interactive Physics-Neural World Model for Deformable Objects from Videos

DeformMaster: 一个用于从视频中生成变形物体交互物理-神经世界模型

Can Li, Zhoujian Li, Ren Li, Jie Gu, Lei Lei, Jingmin Chen, Lei Sun

机构 * Nankai University(南开大学) Zhejiang University(浙江大学) Southern University of Science and Technology(南方科技大学) Rightly Robotics, A4X(Rightly Robotics,A4X) University of Science and Technology of China(中国科学技术大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 本研究提出DeformMaster,一种基于视频的交互物理-神经世界模型,能够从真实交互视频中生成变形物体的统一动态-外观框架,通过保留结构化的物理推演并利用神经残差补偿未建模效应,实现高保真4D外观生成,实验表明其在动态预测和外观渲染方面优于现有方法。

Comments Project page: https://can-lee.github.io/deformmaster-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14392 2026-05-21 cs.LG cs.RO 90%

WestWorld: A Knowledge-Encoded Scalable Trajectory World Model for Diverse Robotic Systems

WestWorld: 一种知识编码的可扩展轨迹世界模型用于多样化机器人系统

Yuchen Wang, Jiangtao Kong, Sizhe Wei, Xiaochang Li, Haohong Lin, Hongjue Zhao, Tianyi Zhou, Lu Gan, Huajie Shao

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 本文提出WestWorld,一种知识编码的可扩展轨迹世界模型,用于多样化机器人系统,通过引入系统感知的混合专家(Sys-MoE)和结构嵌入来提升可扩展性和零样本泛化能力,实现了在多种机器人环境中的高效轨迹预测和控制。

Comments ICML 2026 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16530 2026-05-21 cs.CV 90%

SWoMo: Neuro-Symbolic World Model for Cataract Surgery Simulation

SWoMo:用于白内障手术模拟的神经符号世界模型

Ssharvien Kumar Sivakumar, Akwele Johnson, Anirudh Dhingra, Yannik Frisch, Ghazal Ghazaei, Anirban Mukhopadhyay

机构 * Technical University Darmstadt(德累斯顿技术大学) Carl Zeiss AG(蔡司股份有限公司) AICM, Medical Faculty of Heidelberg University(海德堡大学医学院)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 本文提出SWoMo,一种用于白内障手术模拟的神经符号世界模型,通过分离运动生成与视觉真实性,结合规则基模拟器和场景图表示来建模运动动态和工具-组织交互,同时使用扩散模型生成逼真的视觉效果,从而提升手术模拟的真实性和临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04128 2026-05-21 cs.GR cs.AI cs.CL cs.CV cs.LG 83%

JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation

JoyAI-Image: 激活统一多模态理解和生成中的空间智能

Lin Song, Wenbo Li, Guoqing Ma, Wei Tang, Bo Wang, Yuan Zhang, Yijun Yang, Yicheng Xiao, Jianhui Liu, Yanbing Zhang, Guohui Zhang, Wenhu Zhang, Hang Xu, Nan Jiang, Xin Han, Haoze Sun, Maoquan Zhang, Haoyang Huang, Nan Duan

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出JoyAI-Image,一种统一的多模态基础模型,用于视觉理解、文本到图像生成和指令引导的图像编辑。该模型结合了空间增强的多模态大语言模型(MLLM)和多模态扩散Transformer(MMDiT),通过共享的多模态接口实现感知与生成的交互。构建可扩展的训练配方,结合统一指令微调、长文本渲染监督、空间 grounded 数据和通用及空间编辑信号,使模型具备广泛的多模态能力,同时增强几何感知推理和可控视觉合成。实验表明,JoyAI-Image在理解、生成、长文本渲染和编辑基准上达到最先进的性能。更重要的是,增强的理解、可控的空间编辑和新视角辅助推理之间的双向循环使模型超越一般视觉能力,向更强的空间智能发展。

Comments Code: https://github.com/jd-opensource/JoyAI-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18743 2026-05-21 cs.AI 81%

WorldString: Actionable World Representation

WorldString: 可行动态世界表征

Kunqi Xu, Jitao Li, Jianglong Ye, Tianshu Tang, Isabella Liu, Sifei Liu, Xueyan Zou

机构 * CalTech(加州理工学院) UC San Diego(南加州大学) Tsinghua University - IEI Lab(清华大学-IEI实验室) NVIDIA(英伟达)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出WorldString,一种能够通过点云或RGB-D视频流直接学习现实物体状态流形的神经架构,为构建可行动态世界模型提供基础构建块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21072 2026-05-21 cs.CV 69%

Q-ARVD: Quantizing Autoregressive Video Diffusion Models

Q-ARVD: 对自回归视频扩散模型进行量化

Siao Tang, Xinyin Ma, Gongfan Fang, Xingyi Yang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文针对自回归视频扩散模型(ARVD)的量化问题,提出了一种新的框架Q-ARVD,解决了帧间量化敏感度不平衡和权重中异质性异常模式的问题,从而提高了模型效率。

Comments Code: https://github.com/tsa18/Q-ARVD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20811 2026-05-21 cs.RO 69%

Demo-JEPA: Joint-Embedding Predictive Architecture for One-shot Cross-Embodiment Imitation

Demo-JEPA: 一种用于单次跨体态模仿的联合嵌入预测架构

Jingyang He, Guangrun Li, Jieyu Zhang, Chengkai Hou, Zhengping Che, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) University of Washington(华盛顿大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 本文提出Demo-JEPA,一种跨体态模仿框架,通过解耦示范意图与体态特定的执行,利用共享预测表示空间将源视觉示范转换为目标兼容的未来潜在轨迹,使目标代理通过规划实现这些子目标,从而在异构体态间实现灵活的模仿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11499 2026-05-21 cs.CV 69%

What if Agents Could Imagine? Reinforcing Open-Vocabulary HOI Comprehension through Generation

如果智能体能够想象?通过生成强化开放词汇人-物交互理解

Zhenlong Yuan, Yue Wang, Dapeng Zhang, Kejin Cui, Rui Chen, Jing Tang, Lei Sun, Hongwei Yu, Chengxuan Qian, Xiangxiang Chu, Shuo Li, Yuyin Zhou

机构 * Dream-X Team(Dream-X团队) Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究者) Case Western Reserve University(凯斯西储大学) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出ImagineAgent框架,通过生成式世界建模和工具增强强化学习,解决开放词汇人-物交互理解中的跨模态幻觉和视角限制问题,实现了高效且鲁棒的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 模型式强化学习 2 篇

2605.21478 2026-05-21 cs.CV cs.GR 76%

Latent Dynamics for Full Body Avatar Animation

基于潜在动态的全身动画 avatar

Shichong Peng, Chengxiang Yin, Fei Jiang, Zhongshi Jiang, Lingchen Yang, Qingyang Tan, Amin Jourabloo, Jason Saragih, Ke Li, Christian Häne

机构 * Simon Fraser University(西蒙弗雷泽大学) Codec Avatars Lab, Meta(Meta编码化身实验室)

专题命中 模型式强化学习 :latent dynamics(title,abstract);分类 cs.CV;dynamics model(abstract)

AI总结 本文提出了一种基于潜在动态的全身动画 avatar 方法,通过引入 transformer 解码器和动态残差潜在变量,实现了更精确的动态模拟,提高了动画质量。

Comments Supplementary video: https://youtu.be/xjnr3YM0yIE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20639 2026-05-21 math.OC cs.LG math.DS 74%

Time-Dependent PDE-Constrained Optimization via Weak-Form Latent Dynamics

通过弱形式潜变量动力学进行时间依赖的PDE约束优化

April Tran, Terry Haut, David Bortz, Youngsoo Choi

机构 * Department of Applied Mathematics, University of Colorado(应用数学系,科罗拉多大学) Center for Applied Scientific Computing, Lawrence Livermore National Laboratory(应用科学计算中心,劳伦斯利弗莫尔国家实验室)

专题命中 模型式强化学习 :latent dynamics(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于弱形式潜空间降阶建模的框架,用于加速梯度基PDE约束优化,通过弱形式系统识别方法压缩高维解轨迹并识别参数化潜变量动力学,从而在多查询设计和控制场景中实现高效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏