arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-08-25 至 2026-08-25 共收录 36 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 具身与机器人 4 篇

2608.20735 2026-08-25 cs.AI cs.RO 版本更新 71%

ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation

ForeTime-VLA:面向传送带操作的世界动作模型的因果未来令牌蒸馏

Siyuan Ma, Yutian Zhang, Boshi Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Xiaojin Huang

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Yunshenchu Technology Co., Ltd. (DEEP Robotics)(杭州云深处科技有限公司(深地机器人))

专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.RO

AI总结 该研究提出ForeTime-VLA策略,通过从冻结Fast-WAM教师模型蒸馏因果未来令牌,在传送带操控任务上降低了MAE和L2误差,提升了抓取成功率,验证了该方法的有效性。

Comments 8 pages, 5 figures. Introduces ForeTime-VLA, a causal future-token distillation method for conveyor-belt manipulation from a frozen world action model teacher

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 自动驾驶 3 篇

2608.21414 2026-08-25 cs.RO cs.LG 新提交 89%

RiskWorld: Object-Centric Latent World Modeling for Autonomous Driving Risk Identification

RiskWorld:面向自动驾驶风险识别的以对象为中心的潜在世界建模

Jingzheng Li, Yufei Ge, Qianren Mao, Zhijun Chen, Bing Li, Xingyu Peng, Baochang Zhang, Xianglong Liu

专题命中 自动驾驶 :world model(title,abstract);world model(title,abstract);latent dynamics(abstract);分类 cs.LG、cs.RO

AI总结 提出 RiskWorld 模型,以对象为中心的潜在世界建模,结合预训练视频表示与自车-对象历史,在 RiskBench 上实现 63.0% F1 和 2.1% 误报率,可有效识别自动驾驶风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-08-25 cs.CV 版本更新 81%

ReWorld: Representation Learning for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Zhenxin Zhu, Haiyang Sun, Bing Wang, Guang Chen, Wenyu Liu, Hangjun Ye, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 15 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23486 2026-08-25 cs.CV cs.RO 新提交 71%

GeoWAM: Visual Geometry World Action Models for Autonomous Driving

GeoWAM:面向自动驾驶的视觉几何世界动作模型

Yiren Lu, Xin Ye, Jiaming Liu, Jin Yao, Yi-chung Chen, Liam Merino, Dhruva Dixith Kurra, Min Cai, Tom Lampo, Yu Yin, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(优步自动驾驶实验室) Case Western Reserve University(凯斯西储大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 该研究提出 GeoWAM,一种用于自动驾驶的视觉几何世界动作模型,通过预训练预测未来场景几何来学习动力学,经评估其生成的驾驶策略比图像基方案更强,确立未来几何预测为自动驾驶有效预训练目标。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模型式强化学习 2 篇

2608.18946 2026-08-25 quant-ph cs.AI 版本更新 78%

AlphaClifford: Efficient Clifford Synthesis and Transpilation with Model-based RL

AlphaClifford:基于模型强化学习的高效Clifford电路综合与 transpilation

Daniele Lizzio Bosco, Jacopo Cossio, Carla Piazza, Giuseppe Serra

专题命中 模型式强化学习 :model-based RL(title,abstract);model-based reinforcement learning(abstract);分类 cs.AI

AI总结 本研究提出基于模型强化学习的AlphaClifford框架,用于高效综合Clifford电路,在总门数和CNOT门数上优于现有方法,还可用于硬件约束 transpilation及Clifford+T流程优化,为量子编译提供可扩展途径。

Comments Accepted manuscript to appear in the proceedings of the IEEE International Conference on Quantum Computing and Engineering (QCE 2026). 11 pages, 3 figures. v2: Added discussion and citation of concurrent work by Yeung, Kissinger, and Cornish ( arXiv:2605.10910 (https://arxiv.org/abs/2605.10910) )

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22403 2026-08-25 cs.RO 新提交 76%

LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models

LD4WAM:从人类视频学习世界动作模型的潜在动力学

Zhenhao Shen, Jiaqi Liang, Jasper Lu, Feng Jiang, Yuran Wang, Chuanbo Wei, Jiayi Liu, Jianchun Yang, Qize Yu, Jiadi You, Ce Hao, Guanqi He, Chen Xie, Ruihai Wu

专题命中 模型式强化学习 :latent dynamics(title,abstract);分类 cs.RO;dynamics model(abstract)

AI总结 LD4WAM通过运动对齐的潜在动力学,结合语义重建与真实运动对齐训练的潜在动力学模型和MoT架构的世界动力学动作模型,在RoboTwin仿真及真实机器人上表现良好,可泛化到未见物体与背景。

详情

展开后加载摘要…

URL PDF HTML 收藏