arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9893 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 部署与泛化 163 篇

2502.09268 2025-02-17 cs.RO cs.LG 73%

GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation

Hongyin Zhang, Pengxiang Ding, Shangke Lyu, Ying Peng, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07071 2026-04-09 cs.HC cs.CR 71%

BioMoTouch: Touch-Based Behavioral Authentication via Biometric-Motion Interaction Modeling

BioMoTouch:基于生物-运动交互建模的触控行为认证

Zijian Ling, Jianbang Chen, Hongwei Li, Hongda Zhai, Man Zhou, Jun Feng, Zhengxiong Li, Qi Li, Qian Wang

专题命中 部署与泛化 :action model(title)

AI总结 BioMoTouch通过整合电容触控屏与惯性传感器信号,建立生物特征与行为动态的联合模型,实现高鲁棒性的触控认证,实验显示其在99.71%的平衡准确率和0.27%的误判率下表现优异。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07444 2024-06-12 cs.CL 71%

On the Robustness of Document-Level Relation Extraction Models to Entity Name Variations

Shiao Meng, Xuming Hu, Aiwei Liu, Fukun Ma, Yawen Yang, Shuang Li, Lijie Wen

专题命中 部署与泛化 :action model(title)

Comments Accepted to ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12416 2026-08-14 cs.RO 新提交 70%

RoboSynChallenge: Mastering Real-World Dexterity via Generalizing Synthesized Manipulation Skills

RoboSynChallenge:通过泛化合成操作技能掌握真实世界灵巧操作

Runyi Zhao, Ruixin Wu, Chengkun Li, Hongrui Zhang, Ang Li, Ruixing Jin, Yueci Deng, Yingying Guo, Lihe Ding, Shaocong Dong, Tianfan Xue, Yanjun Gao, Yudong Luo, Pascal Poupart, Simo Wu, Kui Jia, Wei-shi Zheng, Guiliang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce(德克斯力公司) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学) University of Colorado Anschutz(科罗拉多大学安舒茨医学中心) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Vector Institute(向量研究所) University of Waterloo(滑铁卢大学) Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute (SLAI)(深圳环区研究所)

专题命中 部署与泛化 :vision-language-action(abstract,abstract_cn);分类 cs.RO

AI总结 RoboSynChallenge竞赛推出统一基准,结合合成数据与真实评估,提供多类基准策略,旨在推动开发泛化性强、数据高效的机器人操作系统,助力通用机器人智能发展。

Comments NeurIPS 2026 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02195 2026-07-03 cs.RO 新提交 70%

Bridge-WA: Predicting Where and How the World Changes for Robotic Action

Bridge-WA: 预测世界变化的位置和方式以支持机器人动作

Yongjie Bai, Hanting Wang, Mingtong Dai, Qijun Zhong, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) X-Era AI Lab(X-Era AI实验室)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出Bridge-WA轻量框架,通过蒸馏未来变化教师模型为三个紧凑先验,引导动作生成聚焦于场景变化的位置和方式,提升机器人操作的成功率和鲁棒性。

Comments 21 pages, 8 figures, https://hcplab-sysu.github.io/BRIDGE-WA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05291 2026-06-10 cs.RO 版本更新 70%

Online Self-Training for Co-Adaptation in Hierarchical Diffusion Policies

层次扩散策略中的在线自训练协同适应

Clemence Grislain, Mathilde Kappel, Olivier Sigaud, Mohamed Chetouani

机构 * ISIR, Sorbonne Université, CNRS(ISIR,索邦大学,国家科学研究中心)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出ORCHID自训练框架,通过环境反馈过滤轨迹并蒸馏回规划器和控制器,实现层次扩散策略的在线稳定改进,在CALVIN基准上轻量模型超越纯离线方法。

Comments Accepted at ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation (DEMO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09298 2026-03-11 cs.RO 70%

CORAL: Scalable Multi-Task Robot Learning via LoRA Experts

CORAL:通过LoRA专家实现可扩展的多任务机器人学习

Yuankai Luo, Woping Chen, Tong Liang, Zhenguo Li

机构 * Frontier Robotics(前沿机器人)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 CORAL通过LoRA专家实现多任务机器人学习,解决任务干扰问题,提升学习效率与扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07837 2026-02-13 cs.RO 70%

RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AI

RLinf-USER: 一个统一且可扩展的系统,用于具身人工智能中的现实世界在线策略学习

Hongzhi Zang, Shu'ang Yu, Hao Lin, Tianxing Zhou, Zefang Huang, Zhen Guo, Xin Xu, Jiakai Zhou, Yuze Sheng, Shizhe Zhang, Feng Gao, Wenhao Tang, Yufeng Yue, Quanlu Zhang, Xinlei Chen, Chao Yu, Yu Wang

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 RLinf-USER是一个统一且可扩展的系统,用于现实世界中的在线策略学习,通过统一硬件抽象层和异步框架实现多机器人协调与长时训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12993 2026-01-21 cs.RO 70%

Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization

Being-H0.5:面向跨躯体泛化的以人为本的机器人学习规模化

Hao Luo, Ye Wang, Wanpeng Zhang, Sipeng Zheng, Ziheng Xi, Chaoyi Xu, Haiweng Xu, Haoqi Yuan, Chi Zhang, Yiqing Wang, Yicheng Feng, Zongqing Lu

机构 * BeingBeyond Team(BeingBeyond 团队)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 Being-H0.5通过以人为本的学习范式和统一动作空间,实现了在不同机器人平台间的跨躯体泛化,结合混合流框架和流形保持门控,达到模拟和现实中的高性能表现。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18793 2026-01-21 cs.RO 70%

Genie Centurion: Accelerating Scalable Real-World Robot Training with Human Rewind-and-Refine Guidance

Genie Centurion:通过人类 rewind-and-refine 指导加速可扩展的现实世界机器人训练

Wenhao Wang, Jianheng Song, Chiming Liu, Jiayao Ma, Siyuan Feng, Jingyuan Wang, Yuxin Jiang, Kylin Chen, Sikang Zhan, Yi Wang, Tong Meng, Modi Shi, Xindong He, Guanghui Ren, Yang Yang, Maoqing Yao

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 Genie Centurion 通过人类 rewind-and-refine 指导提升现实世界机器人训练效率,实现高任务成功率和低成本数据收集

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01618 2026-01-06 cs.RO 70%

Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation

动作草图生成器:通过视觉草图实现从推理到动作的长周期机器人操作

Huajie Tan, Peterson Co, Yijie Xu, Shanyu Rong, Yuheng Ji, Cheng Chi, Xiansheng Chen, Qiongyu Zhang, Zhongxia Zhao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(1 多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Academy of Artificial Intelligence(2 北京人工智能研究院) University of Sydney(3 新南威尔士大学) Institute of Automation, Chinese Academy of Sciences(4 中国科学院自动化研究所)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 动作草图生成器通过视觉草图实现从推理到动作的长周期机器人操作,结合视觉-语言-动作框架提升任务执行的鲁棒性和可解释性。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15685 2025-11-04 cs.RO 70%

From Grounding to Manipulation: Case Studies of Foundation Model Integration in Embodied Robotic Systems

Xiuchao Sui, Daiying Tian, Qi Sun, Ruirui Chen, Dongkyu Choi, Kenneth Kwok, Soujanya Poria

机构 * IHPC, Agency for Science, Technology and Research, Singapore(科技研究局智能技术中心,新加坡) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

Comments EMNLP 2025 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25122 2025-10-30 cs.RO 70%

NanoVLA: Routing Decoupled Vision-Language Understanding for Nano-sized Generalist Robotic Policies

Jiahong Chen, Jing Wang, Long Chen, Chuwei Cai, Jinghui Lu

机构 * University of British Columbia(不列颠哥伦比亚大学) University of Alberta(阿尔伯塔大学) Xiaomi EV(小米电动车) Northeastern University(东北大学)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14293 2025-10-17 cs.RO cs.AI cs.CV cs.LG 70%

Learning Human-Humanoid Coordination for Collaborative Object Carrying

Yushi Du, Yixuan Li, Baoxiong Jia, Yutang Lin, Pei Zhou, Wei Liang, Yanchao Yang, Siyuan Huang

机构 * Department of Electrical and Electronic Engineering, the University of Hong Kong(香港大学电子与电气工程系) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Yuanpei College, Peking University(北京大学元培学院)

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22195 2025-09-29 cs.RO 70%

Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting

Asher J. Hancock, Xindi Wu, Lihan Zha, Olga Russakovsky, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14317 2025-09-05 cs.RO 70%

ClutterDexGrasp: A Sim-to-Real System for General Dexterous Grasping in Cluttered Scenes

Zeyuan Chen, Qiyang Yan, Yuanpei Chen, Tianhao Wu, Jiyao Zhang, Zihan Ding, Jinzhou Li, Yaodong Yang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学) PKU-AgiBot Lab(北京大学阿吉机器人实验室) PKU-PsiBot Lab(北京大学Psi机器人实验室) Princeton University(普林斯顿大学)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO

Comments Accepted at CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07770 2025-08-14 cs.RO 70%

AgentWorld: An Interactive Simulation Platform for Scene Construction and Mobile Robotic Manipulation

Yizheng Zhang, Zhenjun Yu, Jiaxin Lai, Cewu Lu, Lei Han

机构 * Tencent Robotics X(腾讯机器人X) Shanghai Jiao Tong University(上海交通大学)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO

Comments Accepted by Conference on Robot Learning 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17462 2025-07-24 cs.CV 70%

ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents

Chang Nie, Guangming Wang, Zhe Lie, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University and Key Laboratory of System Control and Information Processing, Ministry of Education of China(自动化与智能感知学院,上海交通大学;系统控制与信息处理重点实验室,中华人民共和国教育部)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07395 2025-05-13 cs.RO 70%

ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning

Hongyin Zhang, Zifeng Zhuang, Han Zhao, Pengxiang Ding, Hongchao Lu, Donglin Wang

机构 * Hongyin Zhang(张 Hongyin) Zifeng Zhuang(庄子峰) Han Zhao(赵涵) Pengxiang Ding(丁鹏祥) Hongchao Lu(卢洪超) Donglin Wang(王东林)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09783 2025-01-20 cs.RO 70%

GeoManip: Geometric Constraints as General Interfaces for Robot Manipulation

Weiliang Tang, Jia-Hui Pan, Yun-Hui Liu, Masayoshi Tomizuka, Li Erran Li, Chi-Wing Fu, Mingyu Ding

机构 * University of YYY(YYY大学) Institute of WWW(WWW研究院)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17846 2024-10-01 cs.RO cs.AI cs.CL cs.CV cs.LG 70%

Hierarchical Open-Vocabulary 3D Scene Graphs for Language-Grounded Robot Navigation

Abdelrhman Werby, Chenguang Huang, Martin Büchner, Abhinav Valada, Wolfram Burgard

专题命中 部署与泛化 :language-conditioned robot(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Code and video are available at http://hovsg.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17846 2026-06-18 cs.RO cs.CV cs.LG 新提交 67%

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Qwen-RobotManip 技术报告:对齐解锁机器人操作基础模型的规模

Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen

机构 * Qwen Team(Qwen团队)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出 Qwen-RobotManip,通过统一的对齐框架(表示、运动和行为维度)实现多源异构操作数据的大规模协同训练,构建约38,100小时预训练语料,在零样本指令跟随、跨本体迁移等泛化能力上超越先前模型。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13328 2026-05-14 cs.RO cs.AI cs.CL cs.CV 67%

What Limits Vision-and-Language Navigation ?

什么是限制视觉-语言导航的因素?

Yunheng Wang, Yuetong Fang, Taowen Wang, Lusong Li, Kun Liu, Junzhe Xu, Zizhao Yuan, Yixiao Feng, Jiaxi Zhang, Wei Lu, Zecui Zeng, Renjing Xu

机构 * HKUST(GZ)(香港科技大学(广州)) JD Explore Academy(京东探索研究院)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出StereoNav框架,通过引入目标-位置先验和立体视觉,提升真实环境导航一致性,实验显示其在RGB性能和参数效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04819 2026-03-06 cs.RO cs.AI cs.LG 67%

On the Strengths and Weaknesses of Data for Open-set Embodied Assistance

关于数据在开放集具身助益中的优势与劣势

Pradyumna Tambwekar, Andrew Silva, Deepak Gopinath, Jonathan DeCastro, Xiongyi Cui, Guy Rosman

专题命中 部署与泛化 :embodied foundation model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文研究了多模态基础模型在开放集辅助任务中的泛化能力,通过合成数据集评估模型在新用户行为和新配置中的表现,揭示了辅助数据集设计对模型性能的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12705 2025-06-19 cs.RO cs.AI cs.LG 67%

DreamGen: Unlocking Generalization in Robot Learning through Video World Models

Joel Jang, Seonghyeon Ye, Zongyu Lin, Jiannan Xiang, Johan Bjorck, Yu Fang, Fengyuan Hu, Spencer Huang, Kaushil Kundalia, Yen-Chen Lin, Loic Magne, Ajay Mandlekar, Avnish Narayan, You Liang Tan, Guanzhi Wang, Jing Wang, Qi Wang, Yinzhen Xu, Xiaohui Zeng, Kaiyuan Zheng, Ruijie Zheng, Ming-Yu Liu, Luke Zettlemoyer, Dieter Fox, Jan Kautz, Scott Reed, Yuke Zhu, Linxi Fan

机构 * NVIDIA University of Washington(华盛顿大学) KAIST(韩国科学技术院) UCLA(加州大学洛杉矶分校) UCSD(加州大学圣地亚哥分校) CalTech(加州理工学院) NTU(国立台湾大学) University of Maryland(马里兰大学) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

Comments See website for videos: https://research.nvidia.com/labs/gear/dreamgen

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01143 2025-04-29 cs.RO cs.AI cs.LG cs.SY eess.SY 67%

ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills

Tairan He, Jiawei Gao, Wenli Xiao, Yuanhang Zhang, Zi Wang, Jiashun Wang, Zhengyi Luo, Guanqi He, Nikhil Sobanbab, Chaoyi Pan, Zeji Yi, Guannan Qu, Kris Kitani, Jessica Hodgins, Linxi "Jim" Fan, Yuke Zhu, Changliu Liu, Guanya Shi

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

Comments RSS 2025. Project website: https://agile.human2humanoid.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05963 2025-02-11 cs.LG cs.AI cs.RO 67%

Redefining Robot Generalization Through Interactive Intelligence

Sharmita Dey

专题命中 部署与泛化 :robot foundation model(abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.06626 2021-01-01 cs.CV cs.LG cs.RO 67%

On Deep Learning Techniques to Boost Monocular Depth Estimation for Autonomous Navigation

Raul de Queiroz Mendes, Eduardo Godinho Ribeiro, Nicolas dos Santos Rosa, Valdir Grassi

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.CV、cs.LG

Comments 29 pages, 16 figures. Preprint published in the Elsevier's Robotics and Autonomous Systems journal on November 23, 2020

Journal ref Journal: Robotics and Autonomous Systems, publisher: Elsevier, volume number: 136, year: 2020, page number: 103701

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14028 2026-08-17 cs.RO cs.AI 新提交 62%

AdvDex: Learning Dexterous Manipulation from Human Demonstrations via Joint-Aligned Actions and Adversarial Learning

AdvDex:通过关节对齐动作与对抗学习从人类演示中学习灵巧操作

Zhiyue Zhao, Jingyi Wu, Hairuo Liu, Mingyu Liu, Liyang Li, Hengdi Zhang, Tong He, Zhengxue Cheng

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Paxini Tech(帕西尼科技)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 AdvDex是一种统一视觉-语言-动作框架,通过OmniShare数据集、JAAS动作空间与领域对抗学习,实现从人类和机器人演示中学习灵巧操作,提升跨实体泛化与技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08127 2026-07-10 cs.CV cs.RO 新提交 62%

Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio

通过时间比率理解和缓解视频动作泛化差距

Utkarsh A. Mishra, Yongxin Chen, Danfei Xu, Yang Liu, Xi Chen, Jiayuan Mao

机构 * Georgia Tech(佐治亚理工学院) Amazon FAR(亚马逊FAR)

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.CV

AI总结 研究视频动作泛化差距,引入时间比率(TR),通过TR衡量动作头对未来潜在展开的依赖程度,提出推理时自适应引导方法,利用TR特性缓解组合泛化差距。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏