arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9146 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9146 篇

2506.13725 2025-06-17 cs.RO 91%

CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding

Wenxuan Song, Jiayi Chen, Pengxiang Ding, Yuxin Huang, Han Zhao, Donglin Wang, Haoang Li

机构 * HKUST(GZ)(香港科技大学(广州)) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06919 2025-01-14 cs.RO 91%

Shake-VLA: Vision-Language-Action Model-Based System for Bimanual Robotic Manipulations and Liquid Mixing

Muhamamd Haris Khan, Selamawit Asfaw, Dmitrii Iarchuk, Miguel Altamirano Cabrera, Luis Moreno, Issatay Tokmurziyev, Dzmitry Tsetserukou

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

Comments Accepted to IEEE/ACM HRI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19590 2024-10-01 cs.RO 91%

RoboNurse-VLA: Robotic Scrub Nurse System based on Vision-Language-Action Model

Shunlei Li, Jin Wang, Rui Dai, Wanyu Ma, Wing Yin Ng, Yingbai Hu, Zheng Li

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06039 2024-08-20 cs.RO 91%

Bi-VLA: Vision-Language-Action Model-Based System for Bimanual Robotic Dexterous Manipulations

Koffivi Fidèle Gbagbe, Miguel Altamirano Cabrera, Ali Alabbas, Oussama Alyunes, Artem Lykov, Dzmitry Tsetserukou

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

Comments The paper was accepted to the IEEE SMC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09448 2026-08-13 cs.RO cs.CV 版本更新 91%

VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction

VANE:通过未来视觉表示预测实现视觉-语言-动作模型的可靠测试时训练

Hongjin Ji, Guoyang Xia, Luoyang Sun, Fangxiang Feng, Lei Ren

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Li Auto Inc.(理想汽车)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出VANE框架,通过条件提示自适应、未来视觉后果学习及候选更新隔离评估的方法,提升VLA策略在闭环操纵中的可靠性,在SimplerEnv WidowX上将平均成功率提高3.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17787 2026-07-22 cs.RO cs.AI 版本更新 91%

AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models

AnchorRefine:基于轨迹锚点和残差细化的轨迹-锚点与残差细化的视觉-语言-动作模型

Tingzheng Jia, Kan Guo, Lanping Qian, Yongli Hu, Daxin Tian, Guixian Qu, Chunmian Lin, Baocai Yin, Jiapu Wang

机构 * Beijing University of Technology(北京理工大学) Beihang University(北航) Nanjing University of Science and Technology(南京理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文提出AnchorRefine框架,通过分解视觉-语言-动作动作建模为轨迹锚点和残差细化,提升几何和接触精度,实验表明在模拟和现实任务中均取得显著提升。

Comments The authors have decided to withdraw this manuscript because the work requires substantial revision and further experimental validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08862 2026-07-15 cs.RO cs.LG 版本更新 91%

APPLV: Adaptive Planner Parameter Learning from Vision-Language-Action Model

APPLV: 从视觉-语言-动作模型中自适应学习规划器参数

Yuanjie Lu, Beichen Wang, Zhengqi Wu, Yang Li, Xiaomin Lin, Chengzhi Mao, Xuesu Xiao

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学) Department of Engineering Science, University of South Florida(工程科学系,佛罗里达州立大学) Department of Computer Science, Rutgers University(计算机科学系,罗格斯大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出APPLV,通过从视觉-语言-动作模型中自适应学习规划器参数,提升移动机器人在受限环境中的导航性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17639 2026-06-17 cs.RO cs.AI 版本更新 91%

RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models

RLRC:基于强化学习的压缩视觉-语言-动作模型恢复

Yuxuan Chen, Yixin Han, Yize Huang, Xiao Li

机构 * State Key Laboratory of Mechanical System and Vibration(机械系统与振动国家重点实验室) Shanghai Key Laboratory of Intelligent Robotics(上海智能机器人重点实验室) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出RLRC三阶段压缩恢复流程,通过结构化剪枝、SFT和强化学习恢复以及量化,实现8倍内存减少和2.3倍推理加速,同时保持任务成功率。

Comments 8 pages, 10 figures; accepted by RA-L 2026

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8864-8871, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15631 2026-06-16 cs.RO cs.AI 新提交 91%

Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time

检索,不重新训练:在测试时将视觉语言动作模型扩展到新任务

Jeongeun Park, Juhan Park, Taekyung Kim, Sungjoon Choi, Dongyoon Han, Sangdoo Yun

机构 * NAVER AI Lab(NAVER AI实验室) Korea University(高丽大学)

专题命中 VLA模型 :action model(title,abstract);vision language action(title);VLA(abstract,abstract_cn);vision-language-action(abstract)

AI总结 提出检索增强策略,通过一次训练冻结模型,部署时仅添加检索数据即可适应新任务,无需逐任务微调,在跨本体泛化中优于基线。

Comments https://recap-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27607 2026-05-29 cs.CV cs.RO 91%

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

双流扩散用于世界模型增强的视觉-语言-动作模型

John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin

机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Technology, Seoul, Republic of Korea(金 Jaechul 人工智能研究生院,韩国科学技术院,首尔,大韩民国)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 提出DUST框架,通过双流扩散Transformer和异步采样方法,解决世界模型增强的视觉-语言-动作模型中的模态差距问题,在模拟和真实任务中取得显著性能提升。

Comments Accepted at ICML 2026. Project page at https://periphanes.github.io/dust (20 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14950 2026-05-15 cs.CV cs.RO 91%

Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model

Evo-Depth:一种轻量化的深度增强视觉-语言-动作模型

Tao Lin, Yuxin Du, Jiting Liu, Nuobei Zhu, Yunhe Li, Yuqian Fu, Yinxinyu Chen, Hongyi Cai, Zewei Ye, Bing Cheng, Kai Ye, Yiran Mao, Yilei Zhong, MingKang Dong, Junchi Yan, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 大学科学与技术大学) Nanyang Technological University(南洋理工大学) SJTU-Quic Robot Joint Lab(上海交通大学-Quick 机器人联合实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出Evo-Depth模型,通过轻量隐式深度编码模块和空间增强模块提升视觉-语言-动作任务中的空间感知能力,实现高效部署与高精度操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03480 2026-04-21 cs.RO cs.AI 91%

SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning

SafeVLA: 通过约束学习实现视觉-语言-动作模型的安全对齐

Borong Zhang, Yuhao Zhang, Jiaming Ji, Yingshan Lei, Yishuai Cai, Josef Dai, Yuanpei Chen, Yaodong Yang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) PKU-PsiBot Joint Lab(北京大学PsiBot联合实验室) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Zhongguancun Academy(中关村学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文提出SafeVLA方法,通过约束学习整合安全约束,有效降低安全违规成本并提升任务成功率,同时确保安全性和泛化能力。

Comments Accepted by NeurIPS 2025 Spotlight Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00695 2026-04-16 cs.RO cs.CV 91%

HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy

HAMLET: 将视觉-语言-动作模型转换为历史感知策略

Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

机构 * KAIST(韩国科学技术院) UC Berkeley(伯克利大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出HAMLET框架,通过引入时刻标记和轻量记忆模块,使视觉-语言-动作模型能关注历史上下文,提升长周期任务表现,实验显示在多个基准测试中均取得显著提升。

Comments ICLR 2026. Project page: https://myungkyukoo.github.io/hamlet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05730 2026-08-07 cs.HC 新提交 90%

SpaceVLA: Spatially Grounded VLA for Robotic Manipulation with User-Authored Grasp and Place Anchors

SpaceVLA:用于机器人操作的空间 grounding VLA,支持用户编写的抓取与放置锚点

Daniia Zinniatullina, Iaroslav Kolomiets, Mikhail Konenkov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract)

AI总结 本研究针对VLA模型操作时缺乏显式空间意图的问题,提出视觉意图锚点的XR流程,通过微调OpenVLA-7B的SpaceVLA模型,在Unity试验中实现91.25%抓取成功率,完成机器人抓取放置任务。

Comments A poster for the ISMAR conference, 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21470 2026-06-23 cs.RO cs.CV cs.LG 新提交 90%

ASCII Art Turns LLMs into VLA Controllers

ASCII艺术将LLMs转化为VLA控制器

Yitao Jiang, Roy Xing, Luyang Zhao, Brian Plancher, Muhao Chen, Devin Balkcom

机构 * Dept. of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) Dept. of Electrical and Computer Engineering, Clemson University(克莱姆森大学电气与计算机工程系) Dept. of Mechanical and Aerospace Engineering, University of Houston(休斯顿大学机械与航空航天工程系)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.CV、cs.LG

AI总结 通过ASCII表示将视觉观察渲染为文本输入,仅使用文本LLM即可实现VLA式控制,在2D操作任务中表现良好,提供轻量级可解释的模态桥接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03724 2026-06-03 cs.CR 90%

Same Weights, Different Robot: A Deployment Safety View of VLA Policies

相同权重,不同机器人:VLA策略的部署安全性视角

Jianwei Tai

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract)

AI总结 本文提出视觉-语言-动作(VLA)策略的部署安全性问题,通过形式化可执行策略规范,揭示相同检查点因动作元数据不匹配导致执行不等价,并给出量化漂移的证书方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23270 2026-05-25 cs.CV cs.AI cs.RO 90%

ChainFlow-VLA: Causal Flow Planning with Vision-Language Models

ChainFlow-VLA: 基于视觉语言模型的因果流规划

Xiyang Wang, Xinlin Wang, Tingguang Zhou, Gong Chen, Xingtai Gui, Zhi Xu, Xiaolei Wu, Feiyang Tan, Hangning Zhou, Mu Yang

机构 * Afari Intelligent Drive(阿法瑞智能驾驶) Tianjin University(天津大学) University of Macau(澳门大学)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 提出ChainFlow-VLA框架,通过自回归生成因果轨迹模式与扩散残差校正的统一概率模型,结合视觉语言模型语义先验,实现自动驾驶中鲁棒的轨迹规划,在NAVSIM v1排行榜上达到94.85分,匹配人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21061 2026-05-21 cs.CV cs.AI cs.RO 90%

Grounding Driving VLA via Inverse Kinematics

通过逆运动学接地驾驶VLA

Junsung Park, Hyunjung Shim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) KimJaeChul AI Graduate School(金 JaeChul人工智能研究生院)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出通过逆运动学求解器重新设计驾驶VLA,以解决轨迹预测中对视觉token的忽略问题,通过引入视觉状态预测和逆运动学网络,提升了视觉接地和轨迹规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09079 2026-03-11 cs.CV cs.AI cs.RO 90%

GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models

GST-VLA: 结构化高斯空间标记用于3D深度感知视觉-语言-动作模型

Md Selim Sarowar, Omer Tariq, Sungho Kim

机构 * Yeungnam University(延世大学) Korea Advanced Institute of Science and Technology, KAIST(韩国科学技术院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 GST-VLA通过结构化高斯空间标记和深度感知链式思维提升3D视觉-语言-动作模型的精度和性能。

Comments The results presented in this paper are preliminary. Please note that the experiments are currently ongoing, and the final data is subject to change upon the completion of the study. All ideas, results, methods, and any content herein are the sole property of the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15475 2026-08-18 cs.CR cs.AI 新提交 90%

Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability

针对视觉-语言-动作模型的位翻转攻击:动作解码架构决定漏洞

Yudong Gao, Linghan Chen, Wenhan Wu, Mia Zhou, Jiyao Wang, Kaiyan Ji, Mingyu Guo, Honglong Chen

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);embodied foundation model(abstract)

AI总结 该研究针对视觉-语言-动作模型提出位翻转攻击,发现动作解码架构决定漏洞,少量梯度选择的位翻转可大幅降低闭环成功率,权重完整性是具身基础模型的安全边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02197 2026-08-04 cs.RO 新提交 90%

Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models

关注关键区域:面向视觉-语言-动作模型的自适应视觉细化

Jin Cui, Yanbin Hu, Xinyue Long, Linkai Li, Boran Zhao, Pengju Ren

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);action model(title);分类 cs.RO

AI总结 针对VLA模型视觉表示不可靠的问题,提出AtVLA框架,结合注意力校正与不确定性门控局部细化,在多基准测试中显著提升机器人操作成功率且计算开销可控。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01573 2026-08-04 cs.RO 新提交 90%

Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models

揭示并缓解视觉-语言-动作模型中的位置盲区

Dongdong An, Pengjie Zhao, Yihao Huang, Wenbing Tang, Ziming He, Jiayi Zhu, Jifeng Ning, Qin Zhao

机构 * Shanghai Normal University(上海师范大学) East China Normal University(华东师范大学) Northwest A&F University(西北农林科技大学) Xidian University(西安电子科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 针对视觉-语言-动作模型存在的位置盲区问题,提出两阶段黑箱框架,通过网格划分与单侧对数似然比检验定位盲区,再经LoRA微调缓解,在五个模型上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02295 2026-07-29 cs.RO 版本更新 90%

CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding

CycleVLA: 通过子任务回溯和最小贝叶斯风险解码实现的前瞻性自修正视觉-语言-动作模型

Chenyang Ma, Kai Lu, Guangyu Yang, Jiuming Liu, Shitong Xu, Bill Byrne, Ioannis Havoutis, Niki Trigoni, Andrew Markham

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Engineering, University of Cambridge(剑桥大学工程系)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 CycleVLA通过子任务回溯和最小贝叶斯风险解码实现前瞻性自修正,提升视觉-语言-动作模型的故障预测与恢复能力

Comments Project Page: https://dannymcy.github.io/cyclevla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31271 2026-07-13 cs.CV 版本更新 90%

DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions

DriveMA:基于可验证元动作的驾驶视觉-语言-动作模型

Weicheng Zheng, Yixin Huang, Qiao Sun, Derun Li, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) Tongji University(同济大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出DriveMA框架,通过可验证元动作弥合语言与动作的差距,结合动作中心监督训练和强化学习实现端到端驾驶规划,在Waymo Open Dataset上取得最优性能。

Comments arXiv admin note: text overlap with arXiv:2605.21273

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05396 2026-07-07 cs.CV cs.AI cs.LG cs.RO 新提交 90%

From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model

从固定相机到自由相机:无需标定的视图鲁棒视觉-语言-动作模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 针对真实机器人部署中相机位姿变动问题,提出CamVLA模型,解耦操控控制与相机几何,实现无标定视图鲁棒的机器人任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04637 2026-07-07 cs.CV 新提交 90%

PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving

PixelPilot:用于端到端自动驾驶的可扩展视觉-语言-动作模型

Pin Tang, Guoqing Wang, Xiangxuan Ren, Zhongdao Wang, Guodongfang Zhao, Bailan, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, Institute of AI, Shanghai Jiao Tong University(教育部人工智能重点实验室,上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有视觉-语言-动作模型在自动驾驶场景中数据可扩展性有限等问题,提出PixelPilot,采用解耦规划和提升范式,通过知识灌输策略学习,提升了模型性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交 90%

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);embodied foundation model(abstract)

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23574 2026-06-23 cs.CR cs.RO 新提交 90%

A Watermark for Vision-Language-Action and World Action Models

视觉-语言-动作与世界动作模型的水印技术

Yule Liu, Shuai Liu, Jiaheng Wei, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学) Xi’an Jiao Tong University(西安交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出密钥潜在来源验证方法,通过替换高斯噪声种子为密钥种子为机器人策略模型添加水印,在保持任务性能的同时实现版权保护,并能抵抗输出移除和权重修改攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22794 2026-06-23 cs.RO 新提交 90%

UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models

UniFS:面向视觉-语言-动作模型的统一快慢层次架构

Lin Sun, Zhiwei Guan, Conglin Wang, Zihong Chen, Jianhai Yu, Zongsheng Li, Boyong He, Tao Sun, Jiale Cao, Lige Liu

机构 * Tianjin University(天津大学) Yiwu Research Institute of Fudan University(复旦大学义乌研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出UniFS统一快慢层次架构,通过分层更新频率、潜向量反转和多级监督策略,解决快慢双系统视觉-语言-动作模型中的频率困境和信息耦合问题,在LIBERO上实现98.3%成功率并提速2.1倍。

Comments Code is opensourced at https://github.com/linsun449/UniFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19565 2026-06-19 cs.CV 新提交 90%

Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models

Mix-QVLA:任务证据感知的视觉-语言-动作模型混合精度量化

Navin Ranjan, Andreas Savakis

机构 * Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);action model(title);分类 cs.CV

AI总结 提出Mix-QVLA框架,通过任务证据感知的混合精度后训练量化,在保持任务性能的同时大幅降低VLA模型的内存和计算开销,在LIBERO上实现4.1GB内存和1.52倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏