arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 6497 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 具身与机器人 510 篇

2411.18289 2025-06-03 cs.RO cs.CV 71%

Don't Let Your Robot be Harmful: Responsible Robotic Manipulation via Safety-as-Policy

Minheng Ni, Lei Zhang, Zihan Chen, Kaixin Bai, Zhaopeng Chen, Jianwei Zhang, Lei Zhang, Wangmeng Zuo

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09723 2025-05-16 cs.RO cs.CV 71%

EnerVerse-AC: Envisioning Embodied Environments with Action Condition

Yuxin Jiang, Shengcong Chen, Siyuan Huang, Liliang Chen, Pengfei Zhou, Yue Liao, Xindong He, Chiming Liu, Hongsheng Li, Maoqing Yao, Guanghui Ren

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

Comments Website: https://annaj2178.github.io/EnerverseAC.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01828 2025-05-05 cs.RO cs.LG 71%

From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment

Yilin Wu, Ran Tian, Gokul Swamy, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(伯克利大学)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00727 2025-03-04 cs.RO cs.AI cs.SC 71%

From Understanding the World to Intervening in It: A Unified Multi-Scale Framework for Embodied Cognition

Maijunxian Wang

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08321 2024-07-19 cs.RO cs.CV 71%

ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic Manipulation

Guanxing Lu, Shiyi Zhang, Ziwei Wang, Changliu Liu, Jiwen Lu, Yansong Tang

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

Comments https://guanxinglu.github.io/ManiGaussian/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06686 2023-12-13 cs.CV cs.RO 71%

Robo360: A 3D Omnispective Multi-Material Robotic Manipulation Dataset

Litian Liang, Liuyu Bian, Caiwei Xiao, Jialin Zhang, Linghao Chen, Isabella Liu, Fanbo Xiang, Zhiao Huang, Hao Su

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02639 2023-10-02 cs.CV cs.RO 71%

ENTL: Embodied Navigation Trajectory Learner

Klemen Kotar, Aaron Walsman, Roozbeh Mottaghi

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07498 2023-08-16 cs.CV cs.AI 71%

DREAMWALKER: Mental Planning for Continuous Vision-Language Navigation

Hanqing Wang, Wei Liang, Luc Van Gool, Wenguan Wang

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

Comments Accepted at ICCV 2023; Project page: https://github.com/hanqingwangai/Dreamwalker

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06498 2023-08-15 cs.AI cs.HC cs.RO 71%

Latent Emission-Augmented Perspective-Taking (LEAPT) for Human-Robot Interaction

Kaiqi Chen, Jing Yu Lim, Kingsley Kuan, Harold Soh

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09864 2022-06-22 cs.AI cs.RO 71%

Towards Using Promises for Multi-Agent Cooperation in Goal Reasoning

Daniel Swoboda, Till Hofmann, Tarik Viehmann, Gerhard Lakemeyer

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

Comments Presented at the ICAPS'22 Workshop on Planning and Robotics (PlanRob)

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.12299 2022-03-24 cs.RO cs.LG 71%

NavDreams: Towards Camera-Only RL Navigation Among Humans

Daniel Dugas, Olov Andersson, Roland Siegwart, Jen Jen Chung

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.07813 2019-08-02 cs.RO cs.CV stat.ML 71%

Learning Real-World Robot Policies by Dreaming

AJ Piergiovanni, Alan Wu, Michael S. Ryoo

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

Journal ref IROS 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0411018 2009-12-01 cs.RO cs.AI 71%

Artificial Intelligence and Systems Theory: Applied to Cooperative Robots

Pedro U. Lima, Luis M. M. Custodio

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

Journal ref International Journal of Advanced Robotic Systems, ISSN 1729-8806, Volume 1, Number 3 September 2004, pp.141-148

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14228 2025-09-18 cs.RO cs.LG 70%

Multi-robot Multi-source Localization in Complex Flows with Physics-Preserving Environment Models

Benjamin Shaffer, Victoria Edwards, Brooks Kinch, Nathaniel Trask, M. Ani Hsieh

机构 * University of Pennsylvania(宾夕法尼亚大学) College of the Atlantic(大西洋学院)

专题命中 具身与机器人 :environment model(title);分类 cs.LG、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16380 2025-06-16 cs.RO cs.HC cs.LG 70%

Learning Multimodal Latent Dynamics for Human-Robot Interaction

Vignesh Prasad, Lea Heitlinger, Dorothea Koert, Ruth Stock-Homburg, Jan Peters, Georgia Chalvatzaki

专题命中 具身与机器人 :latent dynamics(title);分类 cs.LG、cs.RO

Comments Preprint version of paper accepted at IEEE T-RO. Project website: https://sites.google.com/view/mild-hri

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17496 2026-08-19 cs.RO 新提交 69%

Calibrated Predictive Safety for Heterogeneous Robots: An Action-Conditioned JEPA Framework with Model-Based Safety Shields

异构机器人的校准预测安全性:一种带基于模型安全盾的动作条件联合嵌入预测架构(JEPA)框架

Kaiming Zhong, Tianhua Liu, Yue Wang

机构 * Guangdong Bifang Intelligent Control Technology Co., Ltd.(广东毕方智能控制技术有限公司)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 本研究提出带基于模型安全盾的动作条件JEPA框架,用于异构机器人,可预测候选动作的任务进展与物理风险,在仿真中提升了成功率并降低碰撞漏报率。

Comments 17 pages, 9 figures. Simulation-only empirical results on LIBERO-Long (no real-robot experiments). Source, figure-generation scripts and reproducibility checklist included. Level-3 offline reranking significance test not executed; see Sec. 7 (Scope and honesty statement) for detailed disclosure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09305 2026-08-13 cs.RO 69%

Embodied intelligent industrial robotics: Framework and techniques

具身智能工业机器人:框架与技术

Chaoran Zhang, Chenhao Zhang, Zhaobo Xu, Qinghongbing Xie, Jinliang Hou, Pingfa Feng, Long Zeng

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 本文提出了一种新的基于知识的具身智能工业机器人框架,旨在提升工业机器人在复杂环境中的智能水平和应用潜力。

Comments 70 pages, 13 figures. The associated project can be found at https://github.com/jackyzengl/EIIR

Journal ref Journal of Manufacturing Systems 88 (2026) 158-189

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05674 2026-08-07 cs.RO 新提交 69%

JoyAI-RA 0.5: Scaling Robot Manipulation Learning via Dual Action Alignment

JoyAI-RA 0.5:通过双动作对齐扩展机器人操纵学习

RA Team

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 针对机器人操纵学习中异构数据的负迁移问题,提出 JoyAI-RA 0.5 框架,通过双动作对齐结合 VLWA 与强化学习,在 AgiBot 基准上实现性能提升,证明人类弱标注数据可作为扩展操纵能力的核心资源。

Comments Project Page: https://joyai-ra-05.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15278 2026-07-17 cs.CV 新提交 69%

Hierarchical Denoising For Multi-Step Visual Reasoning

用于多步视觉推理的分层去噪

Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) The Hong Kong University of Science and Technology(香港科技大学) Beihang University(北京航空航天大学) Fuzhou University(福州大学) Muka Robotics(木卡机器人)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 研究针对视频模型多步推理不足的问题,提出HDR框架,通过树形层次结构和稀疏分层注意力模式进行多步推理,在新基准测试中提升了成功率和进度,推理更快,数据效率更高,在机器人实验中展现潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27792 2026-07-16 cs.RO 版本更新 69%

Motubrain: An Advanced World Action Model for Robot Control

MotuBrain: 一种先进的世界动作模型用于机器人控制

Motubrain Team, Chendong Xiang, Fan Bao, Haitian Liu, Hengkai Tan, Hongzhe Bi, James Li, Jiabao Liu, Jingrui Pang, Kiro Jing, Louis Liu, Mengchen Cai, Rongxu Cui, Ruowen Zhao, Runqing Wang, Shuhe Huang, Yao Feng, Yinze Rong, Zeyuan Wang, Jun Zhu

机构 * MotuBrain Team(MotuBrain团队)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11397 2026-07-14 cs.RO 新提交 69%

WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos

WALA:从带动作标签的演示和无动作视频中学习可执行的潜在动作

Jiahao Liu, Zhongpu Xia, Shuai Tian, Huangrui Li, Yuhang Zheng, Ning Ma, Xin Fu, Xiaotian Liu, Jing Li, Yixian Li, ShangQing Zhou, Zebin Xing, Linbo Wang, Chaoyue Li, Haoran Li, Dongbin Zhao

机构 * CASIA(中国科学院自动化所) Anyverse Dynamics(Anyverse动力学公司) UCAS(中国科学院大学) NUS(新加坡国立大学) XJYLU(西安交通大学利物浦大学)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 研究从带动作标签演示和无动作视频学习可执行潜在动作的问题,提出WALA框架,先预训练语义几何潜在动作模型,策略训练时编码器和解码器协同,由多方面联合监督潜在动作,实验证明其提升了机器人策略性能和泛化能力。

Comments Project page: https://liujiahao2077.github.io/WALA.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09701 2026-07-14 cs.RO 新提交 69%

EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos

EgoSteer:一个用于从第一人称视角视频实现可控灵巧操作的全栈系统

Yifan Zhong, Zhang Chen, Tianrui Guan, Fanlian Zeng, Yuyao Ye, Tianjia He, Ka Nam Lui, Jiayi Li, Tingrui Zhang, Ruilin Yan, Xinhao Ji, Guangyu Zhao, Wenjie Lou, Jiayuan Zhang, Yuanpei Chen, Yaodong Yang

机构 * Institute for AI, PKU(北京大学人工智能研究院) PKU-PsiBot Joint Lab(北大-灵犀机器人联合实验室) UPenn(宾夕法尼亚大学)

专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.RO

AI总结 针对灵巧手系统因缺乏数据而无可控性的问题,提出全栈系统EgoSteer,集成EgoSmith数据管道等,通过人类数据预训练赋予语言引导操作先验,经机器人后训练强化,能执行多样任务,还开源相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07287 2026-07-10 cs.RO 新提交 69%

TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation

TouchWorld:一种用于灵巧操作的预测性和反应性触觉基础模型

Jianyi Zhou, Feiyang Hong, Yunhao Li, Yicheng Zhao, Yongjue Cen, Zirui Liu, Jiakang Huang, Zirui Chen, Ruiyang Zhang, Weizhuo Zhu, Xuhua Song, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) PHANES AI(PHANES人工智能公司)

专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.RO

AI总结 研究针对日常环境中灵巧操作需预测与反应的问题,提出TouchWorld模型。该模型采用分层策略,分离多项任务。通过将触摸用于预测和反馈,提升局部接触适应性。在六个相关任务中表现出色,超越最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04988 2026-07-07 cs.RO 新提交 69%

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动

Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang

机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)

专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.RO

AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。

Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04352 2026-07-07 cs.CV 新提交 69%

Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach

无人机的最后一米精确导航:一种扩散细化的空中视觉伺服方法

Yaxuan Li, Jiarui Zeng, Shaofei Huang, Zhedong Zheng

机构 * FST and ICI, University of Macau(澳门大学科技学院及资讯与通信技术研究所)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 研究无人机最后一米精确导航,提出DreamNav框架,先粗估计旋转,再用预训练世界模型模拟未来视觉观测选轨迹,贡献PairUAV基准测试,实验表明DreamNav性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30988 2026-07-07 cs.RO 新提交 69%

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

多感官持续学习:将预训练的视觉运动策略适应到力觉

Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 提出MuSe方法,通过多阶段融合、多感官未来预测和预训练数据经验回放,将有限的多感官数据融入预训练的纯视觉策略,在保持原始任务性能的同时适应新任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23685 2026-06-23 cs.RO 新提交 69%

LaST-HD: Learning Latent Physical Reasoning from Scalable Human Data for Robot Manipulation

LaST-HD:从可扩展人类数据中学习潜在物理推理以进行机器人操作

Jiaming Liu, Yinxi Wang, Chenyang Gu, Siyuan Qian, Xiangju Mi, Hao Chen, Jiawei Chen, Qingpo Wuwu, Xiaoqi Li, Nuowei Han, Yiming Zhang, Xuheng Zhang, Yang Yue, Yeqing Yang, Lei Wang, Peng Jia, Hao Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) The Chinese University of Hong Kong(香港中文大学) Simplexity Robotics Aether Tech

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 提出LaST-HD框架,通过将人手与机器人演示在共享潜在推理空间中对齐,利用未配对轨迹训练世界模型合成统一潜在目标,实现跨形态物理动力学内化,并开发低成本数据手套OOL Glove,结合混合训练策略,仅用少量人类数据即可达到高泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22509 2026-06-23 cs.AI 新提交 69%

Imagine to Ensure Safety in Hierarchical Reinforcement Learning

想象以确保分层强化学习的安全性

Gregory Gorbov, Artem Latyshev, Aleksandr I. Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所) FRC Computer Science RAS(俄罗斯科学院联邦研究中心计算机科学研究所)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 提出结合可学习世界模型与高低层策略的分层方法,通过高层生成安全子目标、低层利用想象滚动减少不安全行为,在长时域任务中显著优于现有安全强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14482 2026-06-12 cs.CV 版本更新 69%

V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning

V-JEPA 2.1: 解锁视频自监督学习中的密集特征

Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar, Mido Assran, Koustuv Sinha, Mike Rabbat, Yann LeCun, Nicolas Ballas, Adrien Bardes

机构 * FAIR at Meta(Meta的FAIR) Universidad de Zaragoza(萨拉戈萨大学)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 提出V-JEPA 2.1系列自监督模型,通过密集预测损失、深度自监督、多模态分词器和有效缩放,学习图像和视频的密集高质量视觉表示,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12403 2026-06-11 cs.RO 新提交 69%

World Pilot: Steering Vision-Language-Action Models with World-Action Priors

World Pilot: 用世界动作先验引导视觉-语言-动作模型

Zefu Lin, Rongxu Cui, Junjia Xu, Xiaojuan Jin, Wenling Li, Lue Fan, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Nanjing University(南京大学) Beihang University(北京航空航天大学)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 提出World Pilot框架,通过世界动作模型(WAM)的潜在引导和动作引导两条路径,为VLA模型提供场景演化先验和轨迹级运动提示,在LIBERO-Plus零样本OOD基准上达到84.7%的总成功率,并在多个真实机器人操作任务中取得最高成功率。

Comments Project Website: https://world-pilot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏