arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-03-16 至 2026-03-16 共收录 5 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 5 篇

2603.13215 2026-03-16 cs.CV 96%

Out of Sight, Out of Mind? Evaluating State Evolution in Video World Models

看得不见就忘记了吗?评估视频世界模型中的状态演变

Ziqi Ma, Mengzhan Liufu, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 本文设计STEVO-Bench基准测试,评估视频世界模型能否脱离观察独立演进,揭示其在自然状态演变中的局限性。

Comments https://glab-caltech.github.io/STEVOBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12553 2026-03-16 cs.RO cs.CV 94%

Beyond Dense Futures: World Models as Structured Planners for Robotic Manipulation

超越密集未来:世界模型作为机器人操作的结构化规划器

Minghao Jin, Mozheng Liao, Mingfei Han, Zhihui Li, Xiaojun Chang

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 本文提出StructVLA,通过结构化规划器提升机器人操作的可靠性,采用稀疏结构帧替代密集预测,实现视觉规划与运动控制的结合,实验显示在多个环境中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13024 2026-03-16 cs.CV cs.AI cs.LG eess.IV 91%

SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation

SAW:通过可控且可扩展的视频生成实现手术动作世界模型

Sampath Rapuri, Lalithkumar Seenivasan, Dominik Schneider, Roger Soberanis-Mukul, Yufan He, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Pengfei Guo, Daguang Xu, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) NVIDIA

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。

Comments The manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12655 2026-03-16 cs.CV 90%

VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model

VGGT-World:将VGGT转变为一个自回归的几何世界模型

Xiangyu Sun, Shijie Wang, Fengyi Zhang, Lin Liu, Caiyan Jia, Ziying Song, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Beijing Jiaotong University(北京交通大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 本文提出VGGT-World,通过自回归方法预测冻结几何基础模型特征的时空演变,提升深度预测性能并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09346 2026-03-16 cs.RO 81%

How Safe Will I Be Given What I Saw? Calibrated Prediction of Safety Chances for Image-Controlled Autonomy

给我所见的安全性如何?面向图像控制自主系统的校准安全性预测

Zhenjiang Mao, Mrinall Eashaan Umasudhan, Ivan Ruchkin

机构 * Trustworthy Engineered Autonomy (TEA) Lab(可信工程自主性实验室)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出一种校准的安全性预测框架,用于端到端视觉控制系统,解决部分可观测性和分布偏移下的安全性预测问题,通过无监督域适应和世界模型提升预测鲁棒性。

Comments arXiv admin note: text overlap with arXiv:2308.12252

详情

展开后加载摘要…

URL PDF HTML 收藏