arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9893 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9209 篇

2503.23463 2025-11-24 cs.CV 88%

OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model

OpenDriveVLA: 向端到端自动驾驶迈进的大型视觉语言动作模型

Xingcheng Zhou, Xuyuan Han, Feng Yang, Yunpu Ma, Volker Tresp, Alois Knoll

机构 * Technical University of Munich(慕尼黑技术大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 VLA模型 :vision language action(title,abstract);action model(title,abstract);分类 cs.CV

AI总结 OpenDriveVLA基于开源大语言模型,通过多模态输入和分层视觉语言对齐,实现端到端自动驾驶中的高精度轨迹规划和驾驶任务回答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16166 2025-11-21 cs.CV 88%

EvoVLA: Self-Evolving Vision-Language-Action Model

EvoVLA:自进化视觉-语言-动作模型

Zeting Liu, Zida Yang, Zeyu Zhang, Hao Tang

机构 * Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV

AI总结 EvoVLA通过自监督框架解决VLA模型的阶段幻觉问题,提升任务成功率和样本效率,实现有效的仿真到现实转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13757 2025-11-07 cs.CV 88%

AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning

Zewei Zhou, Tianhui Cai, Seth Z. Zhao, Yun Zhang, Zhiyu Huang, Bolei Zhou, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV

Comments NeurIPS 2025; Website link:https://autovla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13174 2025-11-06 cs.CV 88%

Manipulation Facing Threats: Evaluating Physical Vulnerabilities in End-to-End Vision Language Action Models

Hao Cheng, Erjia Xiao, Yichi Wang, Chengyuan Yu, Mengshu Sun, Qiang Zhang, Jiahang Cao, Yijie Guo, Ning Liu, Kaidi Xu, Jize Zhang, Chao Shen, Philip Torr, Jindong Gu, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Oxford(牛津大学) Xi’an Jiaotong University(西安交通大学) The Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) Beijing University of Technology(北京理工大学) Duke University(杜克大学) X-Humanoid Project(X-Humanoid 项目)

专题命中 VLA模型 :vision language action(title,abstract);action model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01224 2025-11-04 cs.RO 88%

Embodiment Transfer Learning for Vision-Language-Action Models

Chengmeng Li, Yaxin Peng

机构 * Shanghai University(上海大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25713 2025-10-30 cs.RO 88%

Robotic Assistant: Completing Collaborative Tasks with Dexterous Vision-Language-Action Models

Boshi An, Chenyu Yang, Robert Katzschmann

机构 * Soft Robotics Lab, ETHz, Switzerland(苏黎世联邦理工学院软机器人实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18337 2025-10-24 cs.RO 88%

MoTVLA: A Vision-Language-Action Model with Unified Fast-Slow Reasoning

Wenhui Huang, Changhe Chen, Han Qi, Chen Lv, Yilun Du, Heng Yang

机构 * Harvard University(哈佛大学) University of Michigan(密歇根大学) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12276 2025-10-20 cs.RO 88%

Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model

Fuhao Li, Wenxuan Song, Han Zhao, Jingbo Wang, Pengxiang Ding, Donglin Wang, Long Zeng, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tsinghua University(清华大学) Westlake University(西湖大学) Zhejiang University(浙江大学) South China University of Technology(华南理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13375 2025-10-16 cs.CV 88%

DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning

Tianyuan Yuan, Yicheng Liu, Chenhao Lu, Zhuoguang Chen, Tao Jiang, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学智能技术学部)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10975 2025-10-15 cs.RO 88%

RoVer: Robot Reward Model as Test-Time Verifier for Vision-Language-Action Model

Mingtong Dai, Lingbo Liu, Yongjie Bai, Yang Liu, Zhouxia Wang, Rui SU, Chunjie Chen, Liang Lin, Xinyu Wu

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Shanghai AI Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) X-Era AI Lab(X-Era人工智能实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01424 2025-10-14 cs.RO 88%

TriVLA: A Triple-System-Based Unified Vision-Language-Action Model with Episodic World Modeling for General Robot Control

Zhenyang Liu, Yongchong Gu, Sixiao Zheng, Yanwei Fu, Xiangyang Xue, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18269 2025-10-08 cs.RO 88%

FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models

Zhide Zhong, Haodong Yan, Junfeng Li, Xiangchen Liu, Xin Gong, Tianran Zhang, Wenxuan Song, Jiayi Chen, Xinhu Zheng, Hesheng Wang, Haoang Li

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19870 2025-09-25 cs.CV 88%

FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models

Xin Wang, Jie Li, Zejia Weng, Yixu Wang, Yifeng Gao, Tianyu Pang, Chao Du, Yan Teng, Yingchun Wang, Zuxuan Wu, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Sea AI Lab(Sea人工智能实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14138 2025-09-18 cs.RO 88%

SeqVLA: Sequential Task Execution for Long-Horizon Manipulation with Completion-Aware Vision-Language-Action Model

Ran Yang, Zijian An, Lifeng ZHou, Yiming Feng

机构 * Virginia Seafood Agricultural Research and Extension Center, and Department of Biological Systems Engineering, Virginia Tech(弗吉尼亚海产品农业研究中心及生物系统工程系,弗吉尼亚理工学院) Department of Electrical and Computer Engineering, Drexel University(电气与计算机工程系,德雷塞尔大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

Comments 8 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09071 2025-08-14 cs.RO 88%

GeoVLA: Empowering 3D Representations in Vision-Language-Action Models

Lin Sun, Bin Xie, Yingfei Liu, Hao Shi, Tiancai Wang, Jiale Cao

机构 * Tianjin University(天津大学) Dexmal Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

Comments The project is visible at https://linsun449.github.io/GeoVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06547 2025-08-12 cs.RO 88%

A tutorial note on collecting simulated data for vision-language-action models

Heran Wu, Zirun Zhou, Jingfeng Zhang

机构 * School of Computer Science, The University of Auckland(计算机科学学院,奥克兰大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

Comments This is a tutorial note for educational purposes

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14049 2025-07-21 cs.RO cs.CL 88%

EdgeVLA: Efficient Vision-Language-Action Models

Paweł Budzianowski, Wesley Maa, Matthew Freed, Jingxiang Mo, Winston Hsiao, Aaron Xie, Tomasz Młoduchowski, Viraj Tipnis, Benjamin Bolte

机构 * K-Scale Labs(K-Scale实验室) McGill University(麦吉尔大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

Journal ref IROS-MoMA3 Workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01925 2025-07-03 cs.RO 88%

A Survey on Vision-Language-Action Models: An Action Tokenization Perspective

Yifan Zhong, Fengshuo Bai, Shaofei Cai, Xuchuan Huang, Zhang Chen, Xiaowei Zhang, Yuanfei Wang, Shaoyang Guo, Tianrui Guan, Ka Nam Lui, Zhiquan Qi, Yitao Liang, Yuanpei Chen, Yaodong Yang

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) PKU-PsiBot Joint Lab(北京大学PsiBot联合实验室) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

Comments 70 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10826 2025-06-16 cs.RO 88%

RationalVLA: A Rational Vision-Language-Action Model with Dual System

Wenxuan Song, Jiayi Chen, Wenxue Li, Xu He, Han Zhao, Can Cui, Pengxiang Ding Shiyan Su, Feilong Tang, Xuelian Cheng, Donglin Wang, Zongyuan Ge, Xinhu Zheng, Zhe Liu, Hesheng Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Westlake University(西湖大学) Monash University(墨尔本大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10100 2025-06-13 cs.CV 88%

EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models

Yantai Yang, Yuhao Wang, Zichen Wen, Luo Zhongwei, Chang Zou, Zhipeng Zhang, Chuan Wen, Linfeng Zhang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Harbin Institute of Technology(哈尔滨工业大学) Xi’an Jiaotong University(西安交通大学) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03574 2025-06-05 cs.RO 88%

SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models

Meng Li, Zhen Zhao, Zhengping Che, Fei Liao, Kun Wu, Zhiyuan Xu, Pei Ren, Zhao Jin, Ning Liu, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

Comments Website: https://switchvla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21200 2025-05-28 cs.CV 88%

Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models

Xudong Tan, Yaoxin Yang, Peng Ye, Jialin Zheng, Bizhe Bai, Xinyi Wang, Jia Hao, Tao Chen

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Zhangjiang Laboratory(张江实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16640 2025-05-23 cs.CR cs.AI 88%

BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization

Xueyang Zhou, Guiyao Tie, Guowen Zhang, Hechang Wang, Pan Zhou, Lichao Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Lehigh University(莱斯大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.AI

Comments 19 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11214 2025-05-19 cs.RO 88%

Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions

Wei Zhao, Gongsheng Li, Zhefei Gong, Pengxiang Ding, Han Zhao, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05014 2025-05-14 cs.RO cs.AI cs.CV cs.LG 88%

UAV-VLA: Vision-Language-Action System for Large Scale Aerial Mission Generation

Oleg Sautenkov, Yasheerah Yaqoot, Artem Lykov, Muhammad Ahsan Mustafa, Grik Tadevosyan, Aibek Akhmetkazy, Miguel Altamirano Cabrera, Mikhail Martynov, Sausar Karaf, Dzmitry Tsetserukou

机构 * Skoltech(斯克利切夫斯克技术大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title);分类 cs.RO、cs.CV、cs.AI

Comments HRI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12894 2025-05-13 cs.SE cs.RO 88%

VLATest: Testing and Evaluating Vision-Language-Action Models for Robotic Manipulation

Zhijie Wang, Zhehua Zhou, Jiayang Song, Yuheng Huang, Zhan Shu, Lei Ma

机构 * University of Alberta(阿尔伯塔大学) The University of Tokyo(东京大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

Comments To appear in FSE '25 (Proceedings of ACM Software Engineering, Vol. 2, Issue FSE, Article FSE073), 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04339 2024-12-17 cs.CV 88%

RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation

Jiaming Liu, Mengzhen Liu, Zhenyu Wang, Pengju An, Xiaoqi Li, Kaichen Zhou, Senqiao Yang, Renrui Zhang, Yandong Guo, Shanghang Zhang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV

Comments Accepted by Neurips 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06491 2026-07-21 cs.RO cs.AI 版本更新 88%

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

TempoVLA: 学习速度可控的视觉-语言-动作策略

Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

机构 * RUC(中国人民大学) FDU(福建大学) UNC(北卡罗来纳大学教堂山分校)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO、cs.AI

AI总结 提出TempoVLA,通过可变速度轨迹增强和速度条件机制,实现机器人操作中速度的双向灵活控制,并支持动态速度调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31167 2026-07-01 cs.RO cs.AI 新提交 88%

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents

MIRTH:面向视觉-语言-动作智能体的基于互信息推理的时间枢纽

Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.RO、cs.AI

AI总结 提出MIRTH框架,通过双尺度时间记忆枢纽、互信息优化的潜在推理令牌和并行动作解码,解决VLA模型的时间短视、推理鸿沟和推理低效问题,在LIBERO和真实机器人上达到SOTA并展现错误恢复能力。

Comments Accepted as main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14772 2026-06-16 cs.CV cs.AI 新提交 88%

ScoutVLA: UAV-Centric Active Perception via a Dual-Expert VLA Model for Open-World Embodied Question Answering

ScoutVLA:面向开放世界具身问答的无人机中心主动感知双专家VLA模型

Wenhao Lu, Zhengqiu Zhu, Xiaofeng Wang, Xiaoran Zhang, Yatai Ji, Yong Zhao, Yue Hu, Yingzhen Nie, Jinlong Zhu, Zheng Zhu

机构 * National Key Laboratory of Digital Intelligent Modeling and Simulation, National University of Defense Technology(国防科技大学数字智能建模与仿真国家重点实验室) GigaAI

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.AI

AI总结 针对无人机在室外具身问答中细粒度视角调整不足的问题,提出ScoutVLA模型,采用解耦双专家架构(视觉语言专家推断语义意图,动作专家生成连续视角调整轨迹),并通过知识隔离机制平衡连续控制与语义推理,在仿真和真实实验中显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏