arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 584 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 584 篇

2503.03480 2026-04-21 cs.RO cs.AI 62%

SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning

SafeVLA: 通过约束学习实现视觉-语言-动作模型的安全对齐

Borong Zhang, Yuhao Zhang, Jiaming Ji, Yingshan Lei, Yishuai Cai, Josef Dai, Yuanpei Chen, Yaodong Yang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) PKU-PsiBot Joint Lab(北京大学PsiBot联合实验室) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Zhongguancun Academy(中关村学院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出SafeVLA方法,通过约束学习整合安全约束,有效降低安全违规成本并提升任务成功率,同时确保安全性和泛化能力。

Comments Accepted by NeurIPS 2025 Spotlight Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09824 2026-04-14 cs.RO cs.CL cs.CV 62%

ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models

ProGAL-VLA: 通过前瞻性推理实现视觉-语言-动作模型中的 grounded 对齐

Nastaran Darabi, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 ProGAL-VLA 通过构建 3D 实体中心图、使用慢速规划器生成符号子目标,并通过 Grounding Alignment Contrastive 损失对齐实体,提升机器人在扰动下的鲁棒性,减少语言忽略并提高实体检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01718 2026-03-26 cs.RO cs.CV 62%

Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process

统一扩散VLA:通过联合离散去噪扩散过程实现视觉-语言-动作模型

Jiayi Chen, Wenxuan Song, Pengxiang Ding, Ziyang Zhou, Han Zhao, Feilong Tang, Donglin Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Westlake University(西交大学) Zhejiang University(浙江大学) Monash University(墨尔本大学)

专题命中 机器人基础模型 :embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 本文提出统一扩散VLA模型,通过联合离散去噪扩散过程实现视觉语言动作的协同生成与执行,提升多模态任务的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22280 2026-03-24 cs.CV cs.RO 62%

DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models

DualCoT-VLA: 通过并行推理实现视觉-语言链式思维的视觉-语言-动作模型

Zhide Zhong, Junfeng Li, Junjie He, Haodong Yan, Xin Gong, Guanyi Zhao, Yingjie Cai, Jiantao Gao, Xu Yan, Bingbing Liu, Yingcong Chen, Liuqing Yang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Huawei Foundation Model Department(华为基础模型部门)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 DualCoT-VLA通过并行推理机制,结合视觉和语言链式思维,解决传统VLA模型在复杂多步骤任务和精细空间感知中的不足,实现更高效的视觉-语言-动作处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01571 2026-03-24 cs.CV cs.RO 62%

PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model

PixelVLA:推进视觉-语言-动作模型中的像素级理解

Wenqi Liang, Gan Sun, Yao He, Jiahua Dong, Suyan Dai, Ivan Laptev, Salman Khan, Yang Cong

机构 * University of Trento(特伦托大学) School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) Australian National University(澳大利亚国立大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 PixelVLA通过引入多尺度像素感知编码器和视觉提示感知编码器,提升视觉-语言-动作模型的像素级理解和多模态提示能力,在三个基准和两个模型变体中提升了10.1%-28.7%的操控成功率。

Comments 17pages,7 figures, 5 tabels

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13335 2026-03-17 cs.CV cs.AI 62%

Information-Theoretic Constraints for Continual Vision-Language-Action Alignment

信息论视角下的持续视觉-语言-动作对齐约束

Libang Zhao, Qixin Zeng, Hongyin Zhang, Donglin Wang

机构 * Westlake University, China(西湖大学) University of Southampton, UK(南安普顿大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Info-VLA框架,通过两个互补约束保持跨模态信息结构,解决持续学习中视觉语言动作对齐退化问题,实验表明其在任务保持与适应性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10052 2026-03-12 cs.RO cs.LG 62%

OmniGuide: Universal Guidance Fields for Enhancing Generalist Robot Policies

OmniGuide: 通用引导场用于增强通用机器人策略

Yunzhou Song, Long Le, Yong-Hyun Park, Jie Wang, Junyao Shi, Lingjie Liu, Jiatao Gu, Eric Eaton, Dinesh Jayaraman, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 OMNIGUIDE通过整合多种引导源提升通用机器人策略在复杂任务中的性能

Comments Project Page: $\href{https://omniguide.github.io/}{this\; url}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01068 2026-03-11 cs.RO cs.LG 62%

Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition

制定你的策略!通过测试时的分布级组合改进扩散型或流型机器人策略

Jiahang Cao, Yize Huang, Hanzhong Guo, Rui Zhang, Mu Nan, Weijian Mai, Jiaxu Wang, Hao Cheng, Jingkai Sun, Gang Han, Wen Zhao, Qiang Zhang, Yijie Guo, Qihao Zheng, Chunfeng Song, Xiao Li, Ping Luo, Andrew F. Luo

机构 * The University of Hong Kong(香港大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本研究提出无需训练的通用策略组合方法,通过测试时分布级组合提升机器人策略性能。

Comments Accepted to ICLR 2026. Project Page: https://sagecao1125.github.io/GPC-Site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00420 2026-03-03 cs.RO cs.AI cs.SY eess.SY 62%

TMR-VLA:Vision-Language-Action Model for Magnetic Motion Control of Tri-leg Silicone-based Soft Robot

TMR-VLA:一种用于三腿硅基软机器人磁性运动控制的视觉-语言-动作模型

Ruijie Tang, Chi Kit Ng, Kaixuan Wu, Long Bai, Guankun Wang, Yiming Huang, Yupeng Wang, Hongliang Ren

专题命中 机器人基础模型 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 TMR-VLA通过结合视觉、语言和动作模块,实现三腿硅基软机器人的磁性运动控制与导航能力提升。

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13764 2026-02-17 cs.RO cs.AI 62%

MOTIF: Learning Action Motifs for Few-shot Cross-Embodiment Transfer

MOTIF: 为少样本跨躯体迁移学习动作动机

Heng Zhi, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(技术悉尼大学) University of Electronic Science(电子科学大学) Advanced Institute of Big Data(大数据高级研究所)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 MOTIF通过学习动作动机实现高效的少样本跨躯体迁移,提升机器人在新躯体上的动作生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05580 2026-01-29 cs.AI cs.RO 62%

MetaVLA: Unified Meta Co-training For Efficient Embodied Adaption

MetaVLA:统一的元学习协同训练用于高效的具身适应

Chen Li, Zhantao Yang, Han Zhang, Fangyi Chen, Chenchen Zhu, Anudeepsekhar Bolimera, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta Reality Labs, USA(Meta现实实验室(美国))

专题命中 机器人基础模型 :embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 MetaVLA通过统一的元学习协同训练方法,实现高效的具身适应,提升任务泛化能力并降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03038 2026-01-07 cs.RO cs.AI 62%

Validating Generalist Robots with Situation Calculus and STL Falsification

用情况演算和STL反例检验通用机器人

Changwen Li, Rongjie Yan, Chih-Hong Cheng, Jian Zhang

机构 * Key Laboratory of Software System, ISCAS, China(软件系统重点实验室,中国) Carl von Ossietzky Universität Oldenburg, Germany(奥尔登堡卡尔·冯·奥西特齐大学,德国)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出结合情况演算和STL反例检验的两层框架,用于验证通用机器人,通过抽象推理和具体模拟揭示失败案例,提升机器人自主性验证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10008 2025-12-22 cs.RO cs.AI 62%

Phantom Menace: Exploring and Enhancing the Robustness of VLA Models Against Physical Sensor Attacks

幻影威胁:探索和增强VLA模型对物理传感器攻击的鲁棒性

Xuancun Lu, Jiaxiang Chen, Shilin Xiao, Zizhi Jin, Zhangrui Chen, Hanwen Yu, Bohan Qian, Ruochen Zhou, Xiaoyu Ji, Wenyuan Xu

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种新型框架,用于研究和增强VLA模型对物理传感器攻击的鲁棒性,并开发了对抗训练方法以提升模型安全性。

Comments Accepted by AAAI 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03913 2025-12-04 cs.RO cs.AI 62%

Hierarchical Vision Language Action Model Using Success and Failure Demonstrations

基于成功与失败示范的分层视觉语言行动模型

Jeongeun Park, Jihwan Yoon, Byungwoo Jeon, Juhan Park, Jinwoo Shin, Namhoon Cho, Kyungjae Lee, Sangdoo Yun, Sungjoon Choi

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Kim Jaechul Graduate School of AI, KAIST(金在拙人工智能研究生院,韩国科学技术院) Department of Aerospace Engineering, Seoul National University(首尔国立大学航空航天工程系) Departmnet of Statistics, Korea University(韩国大学统计系) NAVER AI Lab(NAVER人工智能实验室)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 VINE通过分层强化学习框架,利用失败数据提升视觉语言行动模型的鲁棒性和执行能力。

Comments https://vine-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21354 2025-11-25 cs.CV cs.AI 62%

KV-Efficient VLA: A Method to Speed up Vision Language Models with RNN-Gated Chunked KV Cache

KV-Efficient VLA: 一种加速视觉语言模型的方法通过RNN门控分块KV缓存

Wanshun Xu, Long Zhuang, Lianlei Shan

机构 * University of Toronto(多伦多大学) Tsinghua University(清华大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 KV-Efficient VLA通过RNN门控分块KV缓存机制,有效降低视觉语言模型的计算和内存开销,提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05642 2025-11-11 cs.RO cs.AR cs.CV cs.SY eess.SY 62%

Lite VLA: Efficient Vision-Language-Action Control on CPU-Bound Edge Robots

Justin Williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

机构 * Department of Cyber-Physical Systems, Clark Atlanta University(克雷克阿特拉大学计算机物理系统系) Siemens Corporation(西门子公司)

专题命中 机器人基础模型 :robotics(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21817 2025-10-28 cs.RO cs.CL cs.LG 62%

VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting

Xiaoyu Liu, Chaoyou Fu, Chi Yan, Chu Wu, Haihan Gao, Yi-Fan Zhang, Shaoqi Dong, Cheng Qian, Bin Luo, Xiuyong Yang, Guanwu Li, Yusheng Cai, Yunhang Shen, Deqiang Jiang, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云图实验室) CASIA(中国科学院自动化研究所) Fourier Intelligence Inc.(傅里叶智能公司)

专题命中 机器人基础模型 :embodied agent(abstract);分类 cs.RO、cs.LG

Comments Homepage: https://lxysl.github.io/VITA-E/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04246 2025-10-07 cs.RO cs.AI 62%

ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context

Huiwon Jang, Sihyun Yu, Heeseung Kwon, Hojin Jeon, Younggyo Seo, Jinwoo Shin

机构 * KAIST(韩国科学技术院) RLWRLD UC Berkeley(伯克利大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

Comments Project page: https://huiwon-jang.github.io/contextvla

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00406 2025-10-02 cs.RO cs.CV 62%

VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators

Hengtao Li, Pengxiang Ding, Runze Suo, Yihao Wang, Zirui Ge, Dongyuan Zang, Kexian Yu, Mingyang Sun, Hongyin Zhang, Donglin Wang, Weihua Su

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) OpenHelix Team(OpenHelix团队) Fudan University(复旦大学) Zhengzhou University(郑州大学) BUPT(北京邮电大学) Hebei University of Technology(河北工业大学)

专题命中 机器人基础模型 :world model(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18865 2025-09-24 cs.RO cs.LG 62%

Bi-VLA: Bilateral Control-Based Imitation Learning via Vision-Language Fusion for Action Generation

Masato Kobayashi, Thanpimon Buamanee

机构 * D3 Center, The University of Osaka(大阪大学D3中心) Graduate School of Information Science and Technology, The University of Osaka(大阪大学信息科学与技术研究生院) Graduate School of Maritime Sciences, Kobe University(兵库大学海运研究生院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15155 2025-09-19 cs.LG cs.RO 62%

Self-Improving Embodied Foundation Models

Seyed Kamyar Seyed Ghasemipour, Ayzaan Wahid, Jonathan Tompson, Pannag Sanketi, Igor Mordatch

机构 * Generalist Google DeepMind(谷歌DeepMind)

专题命中 机器人基础模型 :robotics(abstract);分类 cs.RO、cs.LG

Comments Appearing in the Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16292 2025-08-25 cs.AI cs.RO 62%

Do What? Teaching Vision-Language-Action Models to Reject the Impossible

Wen-Han Hsieh, Elvis Hsieh, Dantong Niu, Trevor Darrell, Roei Herzig, David M. Chan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17294 2025-07-30 cs.RO cs.LG 62%

VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback

Jianxin Bi, Kevin Yuchen Ma, Ce Hao, Mike Zheng Shou, Harold Soh

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.LG

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09160 2025-07-15 cs.RO cs.LG 62%

Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization

Jialei Huang, Shuo Wang, Fanqi Lin, Yihang Hu, Chuan Wen, Yang Gao

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01016 2025-07-02 cs.RO cs.CV 62%

VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers

Yating Wang, Haoyi Zhu, Mingyu Liu, Jiange Yang, Hao-Shu Fang, Tong He

机构 * Shanghai AI Lab(上海人工智能实验室) Tongji(同济) USTC(中国科学技术大学) ZJU(浙江大学) NJU(南京大学) SJTU(上海交通大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08185 2025-06-17 cs.CV cs.AI 62%

Agentic Surgical AI: Surgeon Style Fingerprinting and Privacy Risk Quantification via Discrete Diffusion in a Vision-Language-Action Framework

Huixin Zhan, Jason H. Moore

机构 * Cedars-Sinai Medical Center(西达萨凡纳医学中心)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04693 2025-01-16 cs.RO cs.AI 62%

Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding

Joshua Jones, Oier Mees, Carmelo Sferrazza, Kyle Stachowicz, Pieter Abbeel, Sergey Levine

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01971 2024-10-04 cs.RO cs.LG 62%

Run-time Observation Interventions Make Vision-Language-Action Models More Visually Robust

Asher J. Hancock, Allen Z. Ren, Anirudha Majumdar

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.LG

Comments Website: https://aasherh.github.io/byovla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08283 2026-07-16 cs.RO 版本更新 61%

TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning

TFP:用于视觉运动学习的时间条件记忆融合策略

Yushen Liang, Yue Peng, Baosheng Jin, Tianluo Zhang, Xinyu Zhang, Shuyi Zhou, Zhuoran Chen, Xinqi Liu, Shenji Wan

机构 * University of Electronic Science and Technology of China(电子科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO;robotics(comments)

AI总结 研究针对视觉运动学习中阶段依赖操作问题,提出时间条件记忆融合策略(TFP),通过维护任务进展信念并注入动作解码器来改进VLA策略,在多个任务上提升成功率,证明紧凑且对事件敏感的记忆动态可优化VLA策略。

Comments Accepted to the SemRob 2026 Workshop at Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23147 2026-06-23 cs.RO 新提交 61%

Assistron: Bayesian Shared Autonomy with Off-the-shelf Vision-Language-Action Models

Assistron: 基于现成视觉-语言-动作模型的贝叶斯共享自主

Pinhao Song, Ze Fu, Yutong Hu, Renaud Detry

机构 * KU Leuven(鲁汶大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO;robotics(comments)

AI总结 提出Assistron共享自主模型,利用VLA模型自主执行宏观运动,仅在关键失败点请求人类干预,无需微调VLA,显著提升任务成功率并降低人类工作量。

Comments Using VLA in assistive robotics

详情

展开后加载摘要…

URL PDF HTML 收藏