arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-08-31 至 2026-08-31 共收录 8 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 4 篇

2608.27508 2026-08-31 cs.AI 新提交 93%

WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning

WM-R1:用强化学习训练GUI智能体以推理并利用世界模型

Yu Han, Tianwen Qian

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 该研究提出首个用世界模型替代真实环境训练GUI智能体的强化学习框架WM-R1,在Android基准测试中其性能显著优于仅GRPO的基线方法和推理时模拟方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28541 2026-08-31 cs.LG cs.AI 新提交 93%

An Enclosed Mode Is a Gauge Choice: Topology Relative to Reach in Certified Code World Models

闭合模式是一种规范选择:认证代码世界模型中相对于可达性的拓扑结构

Javier Aguilar Martín

机构 * AGILabs

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 该研究探讨认证代码世界模型中相对于可达性的拓扑,通过LLM合成实验得出三条原则,揭示危险与可达性的关联、修复的限制及缓解措施需匹配错误维度方向的结论。

Comments 33 pages, 2 figures. Paper 3 of a series (companion papers: arXiv:2607.14169 (https://arxiv.org/abs/2607.14169), arXiv:2608.17956 (https://arxiv.org/abs/2608.17956) ). Code, data, and Lean formalization: this https URL (https://github.com/JaviMaligno/code-world-models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27996 2026-08-31 cs.AI 新提交 81%

Should I Use This Synthetic Dataset for Training? How to Test with Minimal Real Data

我应该使用这个合成数据集进行训练吗?如何用最少的真实数据进行测试

Zhenyu Tao, Wei Xu, Xiaohu You, Petar Popovski, Osvaldo Simeone

机构 * Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室) Aalborg University(奥尔堡大学) Northeastern University London(伦敦东北大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出aeSFT方法,用极少真实数据判断合成数据集是否可用于训练,实验表明其识别有用合成数据的效率优于均值序贯测试,性能与固定样本符号翻转测试等相当且假阳性率达标。

Comments Submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28216 2026-08-31 cs.CV 新提交 69%

WALDO: One-Shot Exemplar-Conditioned Object Detection in Cluttered Scenes

WALDO:杂乱场景中的一次性示例条件目标检测

Kishor Datta Gupta, Ahmed Rafi Hasan, Md. Mahfuzur Rahman, Md. Sadman Haque, Mohd Ariful Haque

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(联合国际大学)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.CV

AI总结 本文提出WALDO检测头,利用V-JEPA 2.1特征实现低成本一次性示例条件目标检测,在杂乱场景的AP@50优于Grounding DINO,验证了世界模型特征对定位和不存在检测的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频世界模型 1 篇

2608.28491 2026-08-31 cs.AI cs.RO 新提交 85%

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

AcrossVAM1.0:面向文本辅助机器人视频预测的粒子世界建模

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨越物理人工智能公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视频世界模型 :world model(title);world model(title);分类 cs.AI、cs.RO

AI总结 该研究提出AcrossVAM1.0模型,通过分解为粒子运动与外观,在文本辅助下实现机器人视频预测,在VRS基准上显著降低轨迹误差、提升PSNR/SSIM等指标,但仍存在LPIPS未超越基线等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身与机器人 1 篇

2608.28578 2026-08-31 cs.RO cs.AI cs.LG 新提交 50%

Aero Hand Open: A Simulation-Ready Tendon-Driven Hand for Dexterous Manipulation Learning

Aero Hand Open:一种适用于灵巧操作学习的可仿真肌腱驱动手

Nan Wang, Mohit Yadav, Jonathan Wulff, Aidan Rosenbaum, Kezhou Chen, Yuvan Sharma, Xu Dong, Yiwei Tao

机构 * Chestnut Robotics(栗智机器人) California Institute of Technology(加州理工学院)

专题命中 具身与机器人 :分类 cs.AI、cs.LG、cs.RO;simulation model(abstract)

AI总结 本文提出Aero Hand Open这款仿真就绪的肌腱驱动拟人化手,配套仿真模型、驱动映射与强化学习包,可实现策略在仿真中训练后直接部署到实体手,无需微调与状态估计,并发布了相关全套资源。

Comments 20 pages, 9 figures. Project page: this https URL (https://tetheria.github.io/aero-hand-open/)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模型式强化学习 1 篇

2608.28065 2026-08-31 cs.AI 新提交 85%

Learning to Allocate Incentives for Incentivized Advertising via Offline Model-Based Reinforcement Learning

基于离线模型强化学习的激励式广告激励分配学习

Zilin Zhao, Han Yang, Tianpei Yang, Fangsheng Huang, Yanfei Cui, Kan Peng, Yi Li, Yiming Zong, Hao Zhang, Yinsong Xue

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ByteDance(字节跳动) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 模型式强化学习 :model-based reinforcement learning(title);model-based RL(abstract,abstract_cn);world model(abstract);world model(abstract)

AI总结 本研究针对激励式广告的序列激励分配问题,提出离线模型强化学习框架,实验显示MB-IQL可显著提升人均净利润,验证了该框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真与规划 1 篇

2608.27609 2026-08-31 cs.RO cs.AI 新提交 56%

PHR-VLA: Planning Horizon Reasoning for Vision-Language-Action Models

PHR-VLA:面向视觉-语言-动作模型的规划视界推理

Davood Soleymanzadeh, Kaidi Zhang, Zhiyuan Zhang, Bihao Zhang, Xiao Liang, Yu She, Minghui Zheng

机构 * Texas A&M University(德克萨斯农工大学) Purdue University(普渡大学)

专题命中 仿真与规划 :latent dynamics(abstract);分类 cs.AI、cs.RO

AI总结 该研究针对现有视觉-语言-动作模型缺乏未来任务动态推理机制的问题,提出PHR-VLA框架,通过辅助未来头对齐潜在动态,提升了机器人操纵任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏