arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9146 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9146 篇

2603.25766 2026-03-30 cs.RO cs.AI 91%

ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models

ETA-VLA:通过时间融合和内在LLM稀疏化实现高效标记适应的视觉-语言-动作模型

Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Zichong Gu, Hao Sun

机构 * Bosch Corporate Research, Bosch (China) Investment Ltd.(博世企业研究,博世(中国)投资有限公司) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 本文提出ETA-VLA框架,通过时间融合和内在LLM稀疏化技术,减少视觉-语言-动作模型的计算负担,实验表明在保持高精度的同时,显著降低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01718 2026-03-26 cs.RO cs.CV 91%

Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process

统一扩散VLA:通过联合离散去噪扩散过程实现视觉-语言-动作模型

Jiayi Chen, Wenxuan Song, Pengxiang Ding, Ziyang Zhou, Han Zhao, Feilong Tang, Donglin Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Westlake University(西交大学) Zhejiang University(浙江大学) Monash University(墨尔本大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出统一扩散VLA模型,通过联合离散去噪扩散过程实现视觉语言动作的协同生成与执行,提升多模态任务的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22280 2026-03-24 cs.CV cs.RO 91%

DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models

DualCoT-VLA: 通过并行推理实现视觉-语言链式思维的视觉-语言-动作模型

Zhide Zhong, Junfeng Li, Junjie He, Haodong Yan, Xin Gong, Guanyi Zhao, Yingjie Cai, Jiantao Gao, Xu Yan, Bingbing Liu, Yingcong Chen, Liuqing Yang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Huawei Foundation Model Department(华为基础模型部门)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 DualCoT-VLA通过并行推理机制,结合视觉和语言链式思维,解决传统VLA模型在复杂多步骤任务和精细空间感知中的不足,实现更高效的视觉-语言-动作处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02142 2026-03-23 cs.RO cs.CV 91%

FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation

FD-VLA:力感知的视觉-语言-动作模型用于接触密集的 manipulation

Ruiteng Zhao, Wenshuo Wang, Yicheng Ma, Xiaocong Li, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu

机构 * Advanced Robotics Centre, National University of Singapore(新加坡国立大学先进机器人中心) School of Electrical & Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Information Science and Technology, Eastern Institute of Technology(东部技术学院信息科学与技术学院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Advanced Robotics Centre at National University of Singapore(新加坡国立大学先进机器人中心) Singapore Institute of Manufacturing Technology, Agency for Science, Technology and Research (A*STAR)(新加坡制造技术研究所,科技研究局(A*STAR))

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出FD-VLA模型,通过力蒸馏模块在不依赖物理力传感器的情况下实现接触密集任务的力感知,提升机器人视觉-语言-动作的鲁棒性与实用性。

Comments ICRA 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18953 2026-03-17 cs.RO cs.AI 91%

Eva-VLA: Evaluating Vision-Language-Action Models' Robustness Under Real-World Physical Variations

Eva-VLA:评估视觉-语言-动作模型在现实物理变化下的鲁棒性

Hanqing Liu, Shouwei Ruan, Jiahuan Long, Junqi Wu, Jiacheng Hou, Huili Tang, Tingsong Jiang, Weien Zhou, Wen Yao

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 本文提出Eva-VLA框架,通过将不可控物理变化转化为连续优化问题,系统评估VLA模型的鲁棒性,发现OpenVLA在三种物理变化下的平均失败率超过90%,并验证了对抗训练提升模型鲁棒性的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07904 2026-03-17 cs.LG cs.RO 91%

DyQ-VLA: Temporal-Dynamic-Aware Quantization for Embodied Vision-Language-Action Models

DyQ-VLA: 时序动态感知的视觉-语言-动作模型量化

Zihao Zheng, Hangyu Cao, Sicheng Tian, Jiayu Chen, Maoliang Li, Xinhao Sun, Hailong Zou, Zhaobo Zhang, Xuanzhe Liu, Donggang Cao, Hong Mei, Xiang Chen

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.LG

AI总结 本文提出DyQ-VLA,通过动态量化框架解决视觉-语言-动作模型在时序动态敏感性和实时分配上的问题,实现内存占用降低30.9%且性能保持99.5%,在仿真和现实场景中分别获得1.49倍和1.43倍的速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02310 2026-02-26 cs.RO cs.CV 91%

PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding

PD-VLA:通过并行解码加速集成动作分块的视觉-语言-动作模型

Wenxuan Song, Jiayi Chen, Pengxiang Ding, Han Zhao, Wei Zhao, Zhide Zhong, Zongyuan Ge, Zhijun Li, Donglin Wang, Jun Ma, Lujia Wang, Haoang Li

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 PD-VLA通过并行解码框架提升视觉-语言-动作模型在动作分块中的效率与性能

Comments Accepted by IROS 2025, updated results on LIBERO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10098 2026-02-17 cs.RO cs.CV 91%

VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

VLA-JEPA: 通过潜在世界模型增强视觉-语言-动作模型

Jingwen Sun, Wenyao Zhang, Zekun Qi, Shaojie Ren, Zezhi Liu, Hanxin Zhu, Guangzhong Sun, Xin Jin, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy, Beijing, China(中关村学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 VLA-JEPA通过潜在世界模型提升视觉-语言-动作模型的泛化与鲁棒性,采用无泄露状态预测和两阶段训练策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14666 2025-12-17 cs.RO cs.CV 91%

EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models

EVOLVE-VLA: 通过环境反馈进行测试时训练以实现视觉-语言-动作模型

Zechen Bai, Chen Gao, Mike Zheng Shou

机构 * Show Lab National University of Singapore(新加坡国立大学Show实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 EVOLVE-VLA通过环境反馈实现测试时训练,使视觉-语言-动作模型能持续适应,提升任务性能并实现跨任务泛化。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01623 2025-10-03 cs.CV cs.RO 91%

VLA-R1: Enhancing Reasoning in Vision-Language-Action Models

Angen Ye, Zeyu Zhang, Boyuan Wang, Xiaofeng Wang, Dapeng Zhang, Zheng Zhu

机构 * GigaAI CASIA Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22424 2025-09-23 cs.LG cs.AI 91%

Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance

Songsheng Wang, Rucheng Yu, Zhihang Yuan, Chao Yu, Feng Gao, Yu Wang, Derek F. Wong

机构 * NICS-EFC Lab, Department of Electronic Engineering, Tsinghua University(清华大学电子工程系NICS-EFC实验室) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) Infinigence AI Tsinghua University(清华大学) Zhongguancun Academy(中关村学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.AI、cs.LG

Comments 13 pages, 5 figures, Accepted by EMNLP 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09090 2025-09-12 cs.CV cs.AI 91%

SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models

Hengyu Fang, Yijiang Liu, Yuan Du, Li Du, Huanrui Yang

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与技术学院) University of Arizona(亚利桑那大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.CV、cs.AI

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17294 2025-07-30 cs.RO cs.LG 91%

VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback

Jianxin Bi, Kevin Yuchen Ma, Ce Hao, Mike Zheng Shou, Harold Soh

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.LG

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09160 2025-07-15 cs.RO cs.LG 91%

Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization

Jialei Huang, Shuo Wang, Fanqi Lin, Yihang Hu, Chuan Wen, Yang Gao

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14457 2025-02-05 cs.RO cs.CV 91%

QUAR-VLA: Vision-Language-Action Model for Quadruped Robots

Pengxiang Ding, Han Zhao, Wenjie Zhang, Wenxuan Song, Min Zhang, Siteng Huang, Ningxi Yang, Donglin Wang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

Comments Accepted by ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09337 2026-06-17 cs.RO 版本更新 91%

TORL-VLA: Tactile Guided Online Reinforcement Learning for Contact-Rich Manipulation

TORL-VLA:触觉引导的在线强化学习用于接触丰富操作

Huaihang Zheng, Yi Yang, Kai Ma, Shenglin Xu, Tian Xie, Guozheng Li, Xiangyu Wang, Yiren Ma, Si Liu, Yinian Mao, Baoxu Liu

机构 * Meituan(美团) Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学) State Key Lab of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS(中国科学院自动化研究所多模态人工智能系统国家重点实验室) China University of Mining and Technology (Beijing)(中国矿业大学(北京))

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出TORL-VLA框架,结合触觉反馈与在线强化学习,通过触觉导出的力矩感知VLA预测参考动作,并利用轻量在线RL模块优化动作,解决接触条件变化时的策略适应问题,在长时接触任务中提升成功率和执行效率。

Comments Project page: https://torl-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09928 2026-04-10 cs.RO 91%

HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models

HiF-VLA:通过运动表示实现视觉-语言-动作模型的回顾、洞察与前瞻性

Minghui Lin, Pengxiang Ding, Shu Wang, Zifeng Zhuang, Yang Liu, Xinyang Tong, Wenxuan Song, Shangke Lyu, Siteng Huang, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学) Westlake Robotics(西湖机器人)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 HiF-VLA通过运动表示提升视觉-语言-动作模型的时序推理能力,采用回顾、洞察和前瞻性机制,在长时域任务中表现优异,且推理延迟低。

Comments CVPR 2026, Project page: https://hifvla.github.io, Github: https://github.com/OpenHelix-Team/HiF-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14117 2026-03-10 cs.RO 91%

GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model

GeoAware-VLA: 基于隐式几何的视觉-语言-动作模型

Ali Abouzeid, Malak Mansour, Qinbo Sun, Zezhou Sun, Dezhen Song

机构 * Department of Robotics, Mohamed bin Zayed University of Artificial Intelligence(机器人系,Mohamed bin Zayed人工智能大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 GeoAware-VLA通过整合几何先验提升视觉-语言-动作模型的视角不变性,显著提高零样本泛化能力,并在现实机器人平台中取得显著效果。

Comments Under Review, Project Page https://alisharey.github.io/GeoAware-VLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07845 2026-02-10 cs.RO 91%

Recurrent-Depth VLA: Implicit Test-Time Compute Scaling of Vision-Language-Action Models via Latent Iterative Reasoning

递归深度VLA:通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展

Yalcin Tur, Jalal Naghiyev, Haoquan Fang, Wei-Chuan Tsai, Jiafei Duan, Dieter Fox, Ranjay Krishna

机构 * Stanford University(斯坦福大学) Technical University of Munich(慕尼黑技术大学) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 RD-VLA通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展,提供恒定内存使用和高达80倍的推理加速。

Comments 11 Pages, Project page:https://rd-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09372 2025-09-23 cs.RO 91%

VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model

Yihao Wang, Pengxiang Ding, Lingxiao Li, Can Cui, Zirui Ge, Xinyang Tong, Wenxuan Song, Han Zhao, Wei Zhao, Pengxu Hou, Siteng Huang, Yifan Tang, Wenhui Wang, Ru Zhang, Jianyi Liu, Donglin Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Westlake University(西湖大学) Zhejiang University(浙江大学) OpenHelix Team(OpenHelix团队) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

Comments 28 pages; Project page: https://vla-adapter.github.io/; Github: https://github.com/OpenHelix-Team/VLA-Adapter; HuggingFace: https://huggingface.co/VLA-Adapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07962 2025-09-10 cs.RO 91%

TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models

Zongzheng Zhang, Haobo Xu, Zhuo Yang, Chenghao Yue, Zehao Lin, Huan-ang Gao, Ziwei Wang, Hao Zhao

机构 * Beijing Academy of Artificial Intelligence, BAAI(北京人工智能研究院) Institute for AI Industry Research (AIR), Tsinghua Univeristy(清华大学人工智能产业研究院) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

Comments Accepted to CoRL 2025, project page: \url{https://zzongzheng0918.github.io/Torque-Aware-VLA.github.io/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19958 2025-08-29 cs.RO 91%

Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation

Yiguo Fan, Pengxiang Ding, Shuanghao Bai, Xinyang Tong, Yuyang Zhu, Hongchao Lu, Fengqi Dai, Wei Zhao, Yang Liu, Siteng Huang, Zhaoxin Fan, Badong Chen, Donglin Wang

专题命中 VLA模型 :VLA(title,abstract);vision language action(title);action model(title);vision-language-action(abstract)

Comments Accepted to CoRL 2025; Github Page: https://long-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23757 2025-05-30 cs.CV 91%

Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models

Haohan Chi, Huan-ang Gao, Ziming Liu, Jianing Liu, Chenyu Liu, Jinwei Li, Kaisen Yang, Yangcheng Yu, Zeda Wang, Wenyi Li, Leichen Wang, Xingtao Hu, Hao Sun, Hang Zhao, Hao Zhao

机构 * AIR, Tsinghua University(清华大學人工智能研究院) Bosch Research(博世研究) IIIS, Tsinghua University(清华大學人工智能研究院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV

Comments Project page: https://github.com/ahydchh/Impromptu-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14047 2026-08-17 cs.RO cs.AI cs.CV 新提交 91%

Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use

将视觉-语言-动作模型进化为具备即时工具使用能力的智能体

Yi Ding, Yanzhao Yu, Xili Dai, Xianbiao Qi, Peiwen Sun, Xueqian Wang, Xiangyu Yue, Jianan Wang

机构 * Astribot(星舟机器人) Tsinghua University(清华大学) Juxi Tech(矩芯科技) IntelliFusion Inc.(智融公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究提出带工具使用的智能体机器人(ART)框架,调优VLA模型以利用工具模块,在模拟及真实任务中成功率较基线高20%,为VLA系统实际部署奠定基础。

Comments 12 pages, 4 figures, Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern (CVPR) Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern (CVPR) Findings, 2026, pp. 1346-1357

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15669 2026-08-06 cs.LG cs.AI cs.RO 版本更新 91%

DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models

DeepThinkVLA: 提升视觉-语言-动作模型的推理能力

Cheng Yin, Yankai Lin, Wang Xu, Sikyuen Tam, Xiangrui Zeng, Zhiyuan Liu, Zhouping Yin

机构 * Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系) Gaoling School of Artificial Intelligence, Renmin University of China, China(中国人民大学 Gallagher 人工智能学院) Beijing Zhongguancun Academy, China(北京中关村学院)

专题命中 VLA模型 :vision-language-action(title,abstract_cn);action model(title);VLA(abstract,abstract_cn);vision language action(abstract)

AI总结 本文通过系统实验发现,Co-T推理需满足解码对齐和因果对齐两个条件,提出DeepThinkVLA模型在LIBERO等任务中取得显著提升。

Comments 26 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01586 2026-08-05 cs.CV cs.AI cs.RO 版本更新 91%

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment

VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架

Guoyang Xia, Fengfa Li, Hongjin Ji, Lei Ren, Fangxiang Feng, Kun Zhan, Yan Xie

机构 * Li Auto Inc.(理想汽车) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05681 2026-07-07 cs.RO cs.AI cs.LG 版本更新 91%

Verifier-free Test-Time Sampling for Vision-Language-Action Models

视觉语言动作模型的无验证测试时采样

Suhyeok Jang, Dongyoung Kim, Changyeon Kim, Youngsuk Kim, Jinwoo Shin

机构 * KAIST(韩国科学技术院) Seoul National University(首尔国立大学) RLWRLD

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 针对视觉语言动作模型在高精度任务中的局限,提出无验证测试时缩放框架MG-Select,利用模型内部属性,通过参考动作令牌分布选最优动作,经联合训练改进参考分布,提升模型表现。

Comments Accepted to ICLR 2026. Project page: https://suhyeok-jang.github.io/mg-select/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11618 2026-06-11 cs.IT math.IT 新提交 91%

Vision-Language-Action Models Meet World Models: Embodied Agentic AI for Low-Altitude Wireless Networks

视觉-语言-动作模型遇见世界模型:面向低空无线网络的具身智能体AI

Feibo Jiang, Li Dong, Lei Mao, Kezhi Wang, Cunhua Pan, Dong In Kim, Naofal Al-Dhahir

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title)

AI总结 提出具身智能体无人机框架,以VLA模型为核心实现端到端决策,引入世界模型建模环境动态,通过记忆与反射机制形成闭环优化,实现低空无线网络的鲁棒自主控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07088 2026-05-11 cs.CR 91%

Membership Inference Attacks on Vision-Language-Action Models

针对视觉-语言-动作模型的成员推断攻击

Yuefeng Peng, Mingzhe Li, Kejing Xia, Renhao Zhang, Amir Houmansadr

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title)

AI总结 本文首次系统研究了针对视觉-语言-动作(VLA)模型的成员推断攻击(MIAs),提出了样本级和轨迹级的攻击设置,并展示了在多个VLA基准和模型上,攻击方法在黑盒环境下表现出色,揭示了VLA模型在隐私方面的高风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18043 2026-06-17 cs.RO cs.LG 新提交 91%

Uncertainty Quantification for Flow-Based Vision-Language-Action Models

基于流的视觉-语言-动作模型的不确定性量化

Ralf Römer, Maximilian Seeliger, Saida Liu, Ben Sturgis, Marco Bagatella, Daniel Marta, Andreas Krause, Angela P. Schoellig

机构 * TU Munich(慕尼黑工业大学) ETH Zurich(苏黎世联邦理工学院) MPI IS Tübingen(马克斯·普朗克智能系统研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 提出利用速度场差异(VFD)量化流匹配模型中的认知不确定性,用于故障检测和主动微调,在LIBERO基准上实现高效任务适应。

Comments Project page: tum-lsy.github.io/uq_vla/. 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏