arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-09-01 至 2026-09-01 共收录 5 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 具身与机器人 5 篇

2608.28718 2026-09-01 cs.RO cs.AI cs.CV cs.ET cs.SY eess.SY 新提交 95%

RoboPhys-3D: A Comprehensive Embodied World Model Evaluation via 3D Reconstruction

RoboPhys-3D:通过三维重建进行全面的具身世界模型评估

Tianyi Wang, Jiazhou Chen, Yiming Xu, Xiangyu Li, Tianyi Zeng, Chih-Hsien Chou, Ning Lu, Liang Peng, Junfeng Jiao, Christian Claudel

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Purdue University(普渡大学) Futurewei Technologies, Inc(星纪时代科技公司)

专题命中 具身与机器人 :world model(title,abstract);embodied world model(title,abstract);world model(title,abstract);embodied world model(title,abstract)

AI总结 本研究推出基于RoboTwin 2.0的三维具身世界模型基准RoboPhys-3D,含50个操作任务等数据,提出两个评估分数,发现Cosmos 3的RoboPhyscore最高,该分数与人类评估一致性强。

Comments 66 pages, 12 figures, 55 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24101 2026-09-01 cs.RO 版本更新 86%

TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks

TrAct:通过视觉轨迹连接机器人控制与视觉预测

Zhi Cao, Howard Ji, Kevin Zhang, Kuangzhi Ge, Li Fei-Fei, Jiajun Wu, Huang Huang

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world-model(abstract);world model(abstract)

AI总结 TrAct是基于世界模型的机器人决策框架,以视觉轨迹为控制与预测的中间接口,在LIBERO-INTEGRAL基准和Franka任务上,相较基线π₀.5显著提升了操作成功率与视频预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22067 2026-09-01 cs.RO cs.AI cs.CV cs.LG 版本更新 75%

DELE-w0.5: Inferring Action from Future Latent State for Robotic Manipulation

从未来隐状态推断机器人操纵动作

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren

机构 * DeepLeap Research(DeepLeap研究院)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.CV

AI总结 本文提出无需视频生成的机器人操纵模型DELE-w0.5,通过从捕获动作相关物理结果的未来隐状态推断动作,在4项长程操纵任务的480次试验中,其性能优于最强基线47.5和30.7个百分点,实现最优表现。

Comments DeepLeap Technology Co., Ltd., Shenzhen, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13073 2026-09-01 cs.RO cs.CV 版本更新 71%

Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey

用于机器人操作的基于大型VLM的视觉-语言-动作模型:综述

Rui Shao, Wei Li, Lingsen Zhang, Renshan Zhang, Zhiyang Liu, Ran Chen, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术学院,哈尔滨工业大学(深圳))

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 本综述首次系统分类梳理用于机器人操作的基于大型VLM的VLA模型,明确其定义与两类架构,考察其与先进领域的集成等内容,整合进展并提供更新项目页面

Comments Under Minor Revision at IEEE TPAMI, Project Page: https://github.com/JiuTian-VL/Large-VLM-based-VLA-for-Robotic-Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29937 2026-09-01 cs.AI 新提交 69%

AcrossWAM1.0:A Modular Latent World-Action Stack for Compact Robot Policies

AcrossWAM1.0:用于紧凑机器人策略的模块化潜在世界-动作栈

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨物理人工智能机构) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 该研究针对LaWAM的耦合问题推出AcrossWAM1.0模块化潜在世界-动作栈,在LIBERO实验中实现高成功率,参数规模显著缩小,提供可审计的部署边界。

详情

展开后加载摘要…

URL PDF HTML 收藏