arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-08-31 至 2026-08-31 共收录 13 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 8 篇

2603.23149 2026-08-31 cs.AI 版本更新 94%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13247 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新 94%

Aligning Agentic World Models via Knowledgeable Experience Learning

通过知识性经验学习对齐代理世界模型

Baochang Ren, Yunzhi Yao, Rui Sun, Shuofei Qiao, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27508 2026-08-31 cs.AI 新提交 93%

WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning

WM-R1:用强化学习训练GUI智能体以推理并利用世界模型

Yu Han, Tianwen Qian

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 该研究提出首个用世界模型替代真实环境训练GUI智能体的强化学习框架WM-R1,在Android基准测试中其性能显著优于仅GRPO的基线方法和推理时模拟方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28541 2026-08-31 cs.LG cs.AI 新提交 93%

An Enclosed Mode Is a Gauge Choice: Topology Relative to Reach in Certified Code World Models

闭合模式是一种规范选择:认证代码世界模型中相对于可达性的拓扑结构

Javier Aguilar Martín

机构 * AGILabs

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 该研究探讨认证代码世界模型中相对于可达性的拓扑,通过LLM合成实验得出三条原则,揭示危险与可达性的关联、修复的限制及缓解措施需匹配错误维度方向的结论。

Comments 33 pages, 2 figures. Paper 3 of a series (companion papers: arXiv:2607.14169 (https://arxiv.org/abs/2607.14169), arXiv:2608.17956 (https://arxiv.org/abs/2608.17956) ). Code, data, and Lean formalization: this https URL (https://github.com/JaviMaligno/code-world-models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27345 2026-08-31 cs.CV cs.AI 版本更新 90%

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

PAWBench:我们离概率对齐的世界建模还有多远?

Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jinbo Xing, Xi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Krea AI Huggingface Shanghai Innovation Institute(上海创新研究院) Tongyi Lab(通义实验室) The University of Hong Kong(香港大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 本研究针对当前视频生成器未满足概率对齐世界建模要求的问题,提出PAWBench基准与PAWEval协议,经50种场景和11个系统测试发现无模型达要求,为相关研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27073 2026-08-31 cs.CV cs.RO 版本更新 85%

SpatialCrafter: Single Image World Modeling with Generative 3D Proxies

SpatialCrafter:基于生成式3D代理的单图像世界建模

Chuan Fang, Lingteng Qiu, Yixun Liang, Rui Chen, Kunming Luo, Zhaohua Zheng, Tongyuan Bai, Feipeng Tian, Zilong Dong, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ManyCore Tech Inc.(ManyCore科技公司) Jilin University(吉林大学)

专题命中 通用世界模型 :world model(title);world model(title);分类 cs.CV、cs.RO

AI总结 SpatialCrafter是解决图像到场景生成问题的两阶段框架,通过3D代理及相关策略提升3D一致性,构建了115K场景的新数据集,性能优于现有方法且鲁棒性强。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27996 2026-08-31 cs.AI 新提交 81%

Should I Use This Synthetic Dataset for Training? How to Test with Minimal Real Data

我应该使用这个合成数据集进行训练吗?如何用最少的真实数据进行测试

Zhenyu Tao, Wei Xu, Xiaohu You, Petar Popovski, Osvaldo Simeone

机构 * Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室) Aalborg University(奥尔堡大学) Northeastern University London(伦敦东北大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出aeSFT方法,用极少真实数据判断合成数据集是否可用于训练,实验表明其识别有用合成数据的效率优于均值序贯测试,性能与固定样本符号翻转测试等相当且假阳性率达标。

Comments Submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28216 2026-08-31 cs.CV 新提交 69%

WALDO: One-Shot Exemplar-Conditioned Object Detection in Cluttered Scenes

WALDO:杂乱场景中的一次性示例条件目标检测

Kishor Datta Gupta, Ahmed Rafi Hasan, Md. Mahfuzur Rahman, Md. Sadman Haque, Mohd Ariful Haque

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(联合国际大学)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.CV

AI总结 本文提出WALDO检测头,利用V-JEPA 2.1特征实现低成本一次性示例条件目标检测,在杂乱场景的AP@50优于Grounding DINO,验证了世界模型特征对定位和不存在检测的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频世界模型 1 篇

2608.28491 2026-08-31 cs.AI cs.RO 新提交 85%

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

AcrossVAM1.0:面向文本辅助机器人视频预测的粒子世界建模

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨越物理人工智能公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视频世界模型 :world model(title);world model(title);分类 cs.AI、cs.RO

AI总结 该研究提出AcrossVAM1.0模型,通过分解为粒子运动与外观,在文本辅助下实现机器人视频预测,在VRS基准上显著降低轨迹误差、提升PSNR/SSIM等指标,但仍存在LPIPS未超越基线等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身与机器人 1 篇

2608.28578 2026-08-31 cs.RO cs.AI cs.LG 新提交 50%

Aero Hand Open: A Simulation-Ready Tendon-Driven Hand for Dexterous Manipulation Learning

Aero Hand Open:一种适用于灵巧操作学习的可仿真肌腱驱动手

Nan Wang, Mohit Yadav, Jonathan Wulff, Aidan Rosenbaum, Kezhou Chen, Yuvan Sharma, Xu Dong, Yiwei Tao

机构 * Chestnut Robotics(栗智机器人) California Institute of Technology(加州理工学院)

专题命中 具身与机器人 :分类 cs.AI、cs.LG、cs.RO;simulation model(abstract)

AI总结 本文提出Aero Hand Open这款仿真就绪的肌腱驱动拟人化手,配套仿真模型、驱动映射与强化学习包,可实现策略在仿真中训练后直接部署到实体手,无需微调与状态估计,并发布了相关全套资源。

Comments 20 pages, 9 figures. Project page: this https URL (https://tetheria.github.io/aero-hand-open/)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模型式强化学习 2 篇

2608.24044 2026-08-31 cs.LG 版本更新 88%

JEPA-x: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics

XP-JEPA:用于可预测潜在动力学的交叉预测物理基础

Kehan Wen, Ziming Li, Siyuan Luo, Fan Shi

专题命中 模型式强化学习 :latent dynamics(title,abstract);world model(abstract);world models(abstract);world model(abstract)

AI总结 XP-JEPA通过将视觉与物理表征交叉预测,提升了潜在动力学的可预测性,在多任务套件上降低了展开漂移并提高了控制成功率,无需特权输入即可实现更优的基于展开的控制性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28065 2026-08-31 cs.AI 新提交 85%

Learning to Allocate Incentives for Incentivized Advertising via Offline Model-Based Reinforcement Learning

基于离线模型强化学习的激励式广告激励分配学习

Zilin Zhao, Han Yang, Tianpei Yang, Fangsheng Huang, Yanfei Cui, Kan Peng, Yi Li, Yiming Zong, Hao Zhang, Yinsong Xue

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ByteDance(字节跳动) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 模型式强化学习 :model-based reinforcement learning(title);model-based RL(abstract,abstract_cn);world model(abstract);world model(abstract)

AI总结 本研究针对激励式广告的序列激励分配问题,提出离线模型强化学习框架,实验显示MB-IQL可显著提升人均净利润,验证了该框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真与规划 1 篇

2608.27609 2026-08-31 cs.RO cs.AI 新提交 56%

PHR-VLA: Planning Horizon Reasoning for Vision-Language-Action Models

PHR-VLA:面向视觉-语言-动作模型的规划视界推理

Davood Soleymanzadeh, Kaidi Zhang, Zhiyuan Zhang, Bihao Zhang, Xiao Liang, Yu She, Minghui Zheng

机构 * Texas A&M University(德克萨斯农工大学) Purdue University(普渡大学)

专题命中 仿真与规划 :latent dynamics(abstract);分类 cs.AI、cs.RO

AI总结 该研究针对现有视觉-语言-动作模型缺乏未来任务动态推理机制的问题,提出PHR-VLA框架,通过辅助未来头对齐潜在动态,提升了机器人操纵任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏