arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-08-24 至 2026-08-24 共收录 7 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 6 篇

2608.20401 2026-08-24 cs.AI cs.LG 新提交 94%

World models of environment, agent and joint agent-environment systems

环境、智能体及智能体-环境联合系统的世界模型

Manuel Baltieri, Filippo Torresan, Yivan Zhang, Alexander Boyd, Fernando E. Rosas

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文基于计算力学,将世界模型按建模信道分为三类,构建规范模型并通过POMDP示例说明耦合与支持限制可简化模型复杂度,为世界模型的本质提供了清晰框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20936 2026-08-24 cs.AI cs.RO 新提交 94%

Graph-Operator World Models for Morphology-Parameter Generalization in Continuous Control

用于连续控制中形态参数泛化的图算子世界模型

Xu Yang, Yiqin Yang, Qianchuan Zhao

机构 * Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出GraphOp-WM结构化世界模型,通过分解转移为形态无关局部基与形态相关算子,实现连续控制中铰接机器人家族的形态参数泛化,定义MuJoCo参数划分验证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21075 2026-08-24 cs.SD cs.LG 新提交 93%

AudioWorldSim: Realistic Binaural Audio Datasets For World Models

AudioWorldSim:用于世界模型的真实双耳音频数据集

Luis Vitor Zerkowski, Luiz Velho

机构 * VISGRAF IMPA(巴西纯数学与应用数学国家研究所)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本研究提出开源平台AudioWorldSim,作为SoundSpaces 2.0的自定义扩展,用于生成真实双耳音频数据集,助力基于音频的机器学习尤其是世界模型研究,相关资源已公开以提升可重复性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21114 2026-08-24 cs.CV cs.AI 新提交 88%

CIVA: Critic-Induced Value-Subspace Attacks on Visual World-Model Agents

CIVA:面向视觉世界模型智能体的评论者诱导价值子空间攻击

Jiancheng Wang, Mingli Zhu, Tong Zhang, Jiaqi Ruan, Wei Wang, Siyuan Liang, Dacheng Tao

专题命中 通用世界模型 :world-model(title,abstract);world-model(title,abstract);分类 cs.AI、cs.CV

AI总结 该研究针对视觉世界模型智能体提出CIVA攻击方法,通过提取价值子空间优化扰动,在多个基准任务上优于现有方法,实现了低时间变化下的显著奖励下降。

Comments Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20709 2026-08-24 math.OC 新提交 88%

ResiliFlow: An Open Transport World Model for Infrastructure Perception and Disaster Resilience

ResiliFlow:面向基础设施感知与灾害韧性的开放交通世界模型

Junxiang Xu, Vinayak Dixit, S. Travis Waller, Divya Jayakumar Nair, Qianwen (Vivian)Guo, Sisi Jian, Xiao Wen, Ashutosh Ashutosh, Sunhyung Yoo, Julius Secadiningrat, Jingni Guo

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract)

AI总结 ResiliFlow是面向基础设施感知与灾害韧性的开放交通世界模型平台,整合两类工作空间功能,实现交通模型的可检查复用,支撑研究协作与公众监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20891 2026-08-24 cs.RO cs.CV 新提交 71%

IMU-Free Body-Frame State Estimation with Sparse Scene Flow for Quadcopters

面向四旋翼无人机的基于稀疏场景流的无IMU机体坐标系状态估计

Daniel Grønhaug, Sofie Markeset, Mathias Kolberg

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 该研究提出一种无IMU的四旋翼仅视觉状态估计系统,采用扩展卡尔曼滤波与4视图光束平差法,生成机体坐标系状态估计与稀疏场景流,无需GPS等世界坐标系基础设施。

Comments 56 pages, 5 figures, 2 tables. Evaluated on the VID dataset ( arXiv:2103.11152 (https://arxiv.org/abs/2103.11152) )

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 1 篇

2608.20735 2026-08-24 cs.AI cs.RO 新提交 71%

ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation

ForeTime-VLA:面向传送带操作的世界动作模型的因果未来令牌蒸馏

Siyuan Ma, Yutian Zhang, Boshi Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Xiaojin Huang

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Yunshenchu Technology Co., Ltd. (DEEP Robotics)(杭州云深处科技有限公司(深地机器人))

专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.RO

AI总结 该研究提出ForeTime-VLA策略,通过从冻结Fast-WAM教师模型蒸馏因果未来令牌,在传送带操控任务上降低了MAE和L2误差,提升了抓取成功率,验证了该方法的有效性。

Comments 8 pages, 5 figures. Introduces ForeTime-VLA, a causal future-token distillation method for conveyor-belt manipulation from a frozen world action model teacher

详情

展开后加载摘要…

URL PDF HTML 收藏