arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9893 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9210 篇

2505.15660 2025-10-21 cs.RO cs.CV 84%

Exploring the Limits of Vision-Language-Action Manipulations in Cross-task Generalization

Jiaming Zhou, Ke Ye, Jiayi Liu, Teli Ma, Zifan Wang, Ronghe Qiu, Kun-Yu Lin, Zhilin Zhao, Junwei Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

Comments Project Page: https://jiaming-zhou.github.io/AGNOSTOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14300 2025-10-17 cs.RO cs.AI 84%

Expertise need not monopolize: Action-Specialized Mixture of Experts for Vision-Language-Action Learning

Weijie Shen, Yitian Liu, Yuhao Wu, Zhixuan Liang, Sijia Gu, Dehui Wang, Tian Nian, Lei Xu, Yusen Qin, Jiangmiao Pang, Xinping Guan, Xiaokang Yang, Yao Mu

机构 * MoE key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能混合专家实验室,人工智能研究所,上海交通大学) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) The University of Hong Kong(香港大学) Tongji University(同济大学) D-Robotics Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理重点实验室,中华人民共和国教育部) Shanghai Key Laboratory of Integrated Administration Technologies for Information Security(上海信息安全管理集成技术重点实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08464 2025-10-10 cs.RO cs.LG 84%

Don't Run with Scissors: Pruning Breaks VLA Models but They Can Be Recovered

Jason Jabbour, Dong-Ki Kim, Max Smith, Jay Patrikar, Radhika Ghosal, Youhui Wang, Ali Agha, Vijay Janapa Reddi, Shayegan Omidshafiei

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12723 2025-10-06 cs.CV cs.AI 84%

SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration

Ye Li, Yuan Meng, Zewen Sun, Kangye Ji, Chen Tang, Jiajun Fan, Xinzhu Ma, Shutao Xia, Zhi Wang, Wenwu Zhu

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22199 2025-09-30 cs.RO cs.AI 84%

MimicDreamer: Aligning Human and Robot Demonstrations for Scalable VLA Training

Haoyun Li, Ivan Zhang, Runqi Ouyang, Xiaofeng Wang, Zheng Zhu, Zhiqin Yang, Zhentao Zhang, Boyuan Wang, Chaojun Ni, Wenkang Qin, Xinze Chen, Yun Ye, Guan Huang, Zhenbo Song, Xingang Wang

机构 * GigaAI CASIA NJUST(南京工业大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title,abstract);vision language action(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05667 2025-09-29 cs.CV cs.AI 84%

DriveAction: A Benchmark for Exploring Human-like Driving Decisions in VLA Models

Yuhan Hao, Zhengning Li, Lei Sun, Weilong Wang, Naixin Yi, Sheng Song, Caihong Qin, Mofan Zhou, Yifei Zhan, Xianpeng Lang

机构 * Li Auto Inc.

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.CV、cs.AI

Comments Benchmark: https://huggingface.co/datasets/LiAuto-DriveAction/drive-action

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15937 2025-09-22 cs.RO cs.AI 84%

A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning

Shaopeng Zhai, Qi Zhang, Tianyi Zhang, Fuxian Huang, Haoran Zhang, Ming Zhou, Shengzhe Zhang, Litao Liu, Sixu Lin, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments 26 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22159 2025-09-19 cs.RO cs.CV 84%

ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation

Jiawen Yu, Hairuo Liu, Qiaojun Yu, Jieji Ren, Ce Hao, Haitong Ding, Guangyu Huang, Guofan Huang, Yan Song, Panpan Cai, Cewu Lu, Wenqiang Zhang

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai University(上海大学) Xi’an Jiaotong University(西安交通大学) Noematrix Intelligence(Noematrix智能科技)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19757 2025-09-09 cs.RO cs.CV 84%

Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy

Zhi Hou, Tianyi Zhang, Yuwen Xiong, Haonan Duan, Hengjun Pu, Ronglei Tong, Chengyang Zhao, Xizhou Zhu, Yu Qiao, Jifeng Dai, Yuntao Chen

机构 * Shanghai AI Lab(上海人工智能实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Peking University(北京大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) HKISI, CAS(中国科学院香港中文大学研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(abstract);分类 cs.RO、cs.CV

Comments Preprint; https://robodita.github.io; To appear in ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02055 2025-09-08 cs.RO cs.AI 84%

Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance

Yang Zhang, Chenwei Wang, Ouyang Lu, Yuan Zhao, Yunfei Ge, Zhenglong Sun, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Northwestern Polytechnical University(西北工业大学)

专题命中 VLA模型 :action model(title);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments The first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04063 2025-09-05 cs.RO cs.LG 84%

Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models

Hongyin Zhang, Shiyuan Zhang, Junxi Jin, Qixin Zeng, Yifan Qiao, Hongchao Lu, Donglin Wang

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13103 2025-08-19 cs.RO cs.CV 84%

Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy

Tianyi Zhang, Haonan Duan, Haoran Hao, Yu Qiao, Jifeng Dai, Zhi Hou

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shanghai AI Lab(上海人工智能实验室) SenseTime Research(商汤科技研究院) Nanjing University(南京大学) Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02190 2025-08-05 cs.RO cs.AI 84%

FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic Manipulation

Cui Miao, Tao Chang, Meihan Wu, Hongbin Xu, Chun Li, Ming Li, Xiaodong Wang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18867 2025-06-27 cs.CV cs.AI 84%

UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent

Jianke Zhang, Yanjiang Guo, Yucheng Hu, Xiaoyu Chen, Xiang Zhu, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University,Beijing, China(信息科学交叉研究所,清华大学,北京,中国) Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院,上海,中国)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05540 2025-06-18 cs.CV cs.LG 84%

Benchmarking Vision, Language, & Action Models in Procedurally Generated, Open Ended Action Environments

Pranav Guruprasad, Yangyue Wang, Sudipta Chowdhury, Harshvardhan Sikka, Paul Pu Liang

机构 * Manifold Research MIT(麻省理工学院)

专题命中 VLA模型 :action model(title);vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.LG

Comments 16 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08185 2025-06-17 cs.CV cs.AI 84%

Agentic Surgical AI: Surgeon Style Fingerprinting and Privacy Risk Quantification via Discrete Diffusion in a Vision-Language-Action Framework

Huixin Zhan, Jason H. Moore

机构 * Cedars-Sinai Medical Center(西达萨凡纳医学中心)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18719 2025-05-27 cs.RO cs.AI 84%

VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning

Guanxing Lu, Wenkai Guo, Chubin Zhang, Yuheng Zhou, Haonan Jiang, Zifeng Gao, Yansong Tang, Ziwei Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15830 2025-05-20 cs.RO cs.AI 84%

SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model

Delin Qu, Haoming Song, Qizhi Chen, Yuanqi Yao, Xinyi Ye, Yan Ding, Zhigang Wang, JiaYuan Gu, Bin Zhao, Dong Wang, Xuelong Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) ShanghaiTech University(上海科技大学) Northwestern Polytechnical University(西北工业大学)

专题命中 VLA模型 :action model(title,abstract);robot foundation model(abstract);分类 cs.RO、cs.AI

Journal ref Robotics: Science and Systems, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03912 2025-05-08 cs.RO cs.CV 84%

OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation

Can Cui, Pengxiang Ding, Wenxuan Song, Shuanghao Bai, Xinyang Tong, Zirui Ge, Runze Suo, Wanqi Zhou, Yang Liu, Bofang Jia, Han Zhao, Siteng Huang, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Xi’an Jiaotong University(西安交通大学) HKUST(GZ) Project Lead(香港科技大学(广州)项目负责人)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05450 2025-04-15 cs.RO cs.AI 84%

ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy

Yuhui Chen, Shuai Tian, Shugao Liu, Yingting Zhou, Haoran Li, Dongbin Zhao

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00114 2024-11-01 cs.LG cs.AI cs.CL 84%

OmniJARVIS: Unified Vision-Language-Action Tokenization Enables Open-World Instruction Following Agents

Zihao Wang, Shaofei Cai, Zhancun Mu, Haowei Lin, Ceyao Zhang, Xuejie Liu, Qing Li, Anji Liu, Xiaojian Ma, Yitao Liang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.AI、cs.LG

Comments accepted on NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15549 2024-10-22 cs.RO cs.CV 84%

A Dual Process VLA: Efficient Robotic Manipulation Leveraging VLM

ByungOk Han, Jaehong Kim, Jinhyeok Jang

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

Comments 10 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07775 2024-07-15 cs.RO cs.AI 84%

Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs

Hao-Tien Lewis Chiang, Zhuo Xu, Zipeng Fu, Mithun George Jacob, Tingnan Zhang, Tsang-Wei Edward Lee, Wenhao Yu, Connor Schenck, David Rendleman, Dhruv Shah, Fei Xia, Jasmine Hsu, Jonathan Hoech, Pete Florence, Sean Kirmani, Sumeet Singh, Vikas Sindhwani, Carolina Parada, Chelsea Finn, Peng Xu, Sergey Levine, Jie Tan

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08122 2026-03-10 cs.RO 84%

Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA

通过强化学习增强的遥控操作与混合的灵巧专家VLA实现人机操作

Tutian Tang, Xingyu Ji, Wanli Xing, Ce Hao, Wenqiang Xu, Lin Shao, Cewu Lu, Qiaojun Yu, Jiangmiao Pang, Kaifeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Sharpa Shanghai AI Lab(上海人工智能实验室) Zhongguancun Academy(中关村学院) National University of Singapore(新加坡国立大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出IMCopilot和MoDE-VLA框架,通过强化学习和多模态融合提升机器人灵巧操作能力,实现接触丰富的手内任务性能提升。

Comments Project Homepage: https://sites.google.com/view/mode-vla

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09607 2025-10-20 cs.CV 84%

VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation

Shaoqi Dong, Chaoyou Fu, Haihan Gao, Yi-Fan Zhang, Chi Yan, Chu Wu, Xiaoyu Liu, Yunhang Shen, Jing Huo, Deqiang Jiang, Haoyu Cao, Yang Gao, Xing Sun, Ran He, Caifeng Shan

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) CASIA(中国科学院自动化研究所)

专题命中 VLA模型 :VLA(title,abstract);action model(abstract);分类 cs.CV

Comments Homepage: https://ltbai.github.io/VITA-VLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22441 2025-09-29 cs.RO 84%

UnderwaterVLA: Dual-brain Vision-Language-Action architecture for Autonomous Underwater Navigation

Zhangyuan Wang, Yunpeng Zhu, Yuqi Yan, Xiaoyuan Tian, Xinhao Shao, Meixuan Li, Weikun Li, Guangsheng Su, Weicheng Cui, Dixia Fan

机构 * School of Engineering, Westlake University(西lake大学工程学院) College of Information Science & Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) College of Environmental and Resource Sciences, Zhejiang University(浙江大学环境与资源科学学院) Australian National University(澳大利亚国立大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,comments);分类 cs.RO

Comments This paper introduces the first VLA framework for AUVs, featuring a dual-brain architecture and zero-data MPC for real-world underwater navigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07267 2026-08-21 cs.AI cs.CV cs.RO 版本更新 83%

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04196 2026-08-06 cs.RO cs.CV cs.LG 新提交 83%

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation

SiMDex:挖掘相似的自我中心视频以实现跨 embodiment 的灵巧操作

Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato

机构 * The University of Tokyo(东京大学) ByteDance Seed(字节跳动 Seed) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 该研究提出SiMDex框架,通过三层流程从海量自我中心人类视频中挖掘与任务相关的子集,用于VLA后训练,仅用少量样本便显著提升了机器人灵巧操作的成功率,证明选择性数据整理更有效。

Comments 12 pages, 4 figures. Project page: https://lin-nie.github.io/SiMDex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-07-14 cs.RO cs.AI cs.CL cs.CV 版本更新 83%

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments Code can be found in https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15298 2026-05-18 cs.RO cs.AI cs.CL cs.CV 83%

PhysBrain 1.0 Technical Report

PhysBrain 1.0 技术报告

Shijie Lian, Bin Yu, Xiaopeng Lin, Changti Wu, Hang Yuan, Xiaolin Hu, Zhaolong Shen, Yuzhuo Miao, Haishan Liu, Yuxuan Tian, Yukun Shi, Cong Huang, Kai Chen

机构 * PhysBrain Team(PhysBrain团队)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 PhysBrain 1.0 通过将大规模人类自体视频转化为结构化的物理常识监督,提升机器人适应能力,在多模态问答和具身控制基准测试中取得SOTA结果,尤其在SimplerEnv中表现突出。

Comments Project Page: https://phys-brain.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏