arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2025-12-19 至 2025-12-19 共收录 6 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 2 篇

2510.12796 2025-12-19 cs.CV cs.AI 93%

DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving

DriveVLA-W0:世界模型放大数据扩展定律在自动驾驶中的应用

Yingyan Li, Shuyao Shang, Weisong Liu, Bing Zhan, Haochen Wang, Yuqi Wang, Yuntao Chen, Xiaoman Wang, Yasong An, Chufeng Tang, Lu Hou, Lue Fan, Zhaoxiang Zhang

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences (CASIA)(国家工程实验室、自动化研究所、中国科学院(CASIA)) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 DriveVLA-W0通过世界建模预测未来图像,提升自动驾驶中数据扩展定律,实现更高效的驾驶智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16924 2025-12-19 cs.CV 81%

The World is Your Canvas: Painting Promptable Events with Reference Images, Trajectories, and Text

世界是你的画布:通过参考图像、轨迹和文本绘画可提示事件

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Yue Yu, Yihao Meng, Wen Wang, Ka Leong Cheng, Shuailei Ma, Qingyan Bai, Yixuan Li, Cheng Chen, Yanhong Zeng, Xing Zhu, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) NEU(南京大学) CUHK(香港中文大学) NTU(南洋理工大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 WorldCanvas通过结合文本、轨迹和参考图像,实现可提示的多代理交互事件生成,提升世界模型的交互性和可控性。

Comments Project page and code: https://worldcanvas.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 2 篇

2512.16461 2025-12-19 cs.CV cs.RO 71%

SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning

SNOW:基于世界知识的时空场景理解用于开放世界具身推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业联合会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 SNOW通过整合视觉语言模型与点云几何,实现统一的4D场景理解,提升开放世界具身推理的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15940 2025-12-19 cs.CV cs.RO 71%

R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space

R4:在4D时空空间中为视觉语言模型引入检索增强推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业协会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 R4通过构建4D时空知识库,使视觉语言模型具备结构化终身记忆,实现无需训练的检索增强推理,提升动态环境中的具身推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模型式强化学习 1 篇

2510.08226 2025-12-19 cs.LG 50%

UAMDP: Uncertainty-Aware Markov Decision Process for Risk-Constrained Reinforcement Learning from Probabilistic Forecasts

UAMDP:面向风险约束强化学习的概率预测不确定性感知马尔可夫决策过程

Michal Koren, Or Peretz, Tai Dinh, Philip S. Yu

机构 * The Kyoto College of Graduate Studies for Informatics(京都大学研究生院信息学研究科) Department of Computer Science, University of Illinois at Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 UAMDP通过整合概率预测、后验不确定性探索和风险约束规划,提升高波动环境下序列决策的安全性和盈利能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仿真与规划 1 篇

2505.16787 2025-12-19 cs.AI 75%

Enter the Void - Planning to Seek Entropy When Reward is Scarce

进入虚无 - 在奖励稀缺时规划以寻求熵

Ashish Sundar, Chunbo Luo, Xiaoyang Wang

机构 * Department of Computer Science University of Exeter(计算机科学系埃克塞特大学)

专题命中 仿真与规划 :world model(abstract);world model(abstract);model-based reinforcement learning(abstract);分类 cs.AI

AI总结 本文提出了一种基于世界模型的分层规划方法,在奖励稀缺时主动寻找信息丰富的状态,提升样本效率,应用于Dreamer时在迷宫任务中效率提升50%。

Comments 10 pages without appendix, 15 Figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏