arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-03 至 2026-02-03 共收录 16 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 16 篇

2510.24795 2026-02-03 cs.CV cs.AI cs.LG cs.RO 90%

A Survey on Efficient Vision-Language-Action Models

高效视觉-语言-动作模型的综述

Zhaoshu Yu, Bo Wang, Pengpeng Zeng, Haonan Zhang, Ji Zhang, Zheng Wang, Lianli Gao, Jingkuan Song, Nicu Sebe, Heng Tao Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机科学与人工智能学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文综述了高效视觉-语言-动作模型,系统分类了模型设计、训练和数据收集三个核心领域,总结了最新方法并提出了未来研究方向。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02212 2026-02-03 cs.CV 90%

MAIN-VLA: Modeling Abstraction of Intention and eNvironment for Vision-Language-Action Models

MAIN-VLA: 为视觉语言动作模型建模意图和环境的抽象

Zheyuan Zhou, Liang Du, Zixun Sun, Xiaoyu Zhou, Ruimin Ye, Qihao Chen, Yinda Chen, Lemiao Qiu

机构 * IEG, Tencent(腾讯人工智能实验室) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title);action model(title);分类 cs.CV

AI总结 MAIN-VLA通过建模意图和环境的抽象,提升视觉语言动作模型在复杂动态环境中的决策质量、泛化能力和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01158 2026-02-03 cs.CV cs.RO 88%

Improving Robustness of Vision-Language-Action Models by Restoring Corrupted Visual Inputs

通过恢复损坏的视觉输入来提高视觉-语言-动作模型的鲁棒性

Daniel Yezid Guarnizo Orjuela, Leonardo Scappatura, Veronica Di Gennaro, Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering(电子信息与生物工程系)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出CRT模块,通过对抗训练恢复损坏的视觉输入,提升VLA模型在现实环境中的鲁棒性与性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00743 2026-02-03 cs.RO cs.AI 88%

SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning

SA-VLA:面向视觉-语言-动作强化学习的空间感知流匹配

Xu Pan, Zhenglin Wan, Xingrui Yu, Xianwei Zheng, Youkai Ke, Ming Sun, Rui Wang, Ziwei Wang, Ivor Tsang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.RO、cs.AI

AI总结 SA-VLA通过空间感知的RL适应框架,在强化学习微调中保持空间定位,提升视觉-语言-动作任务的鲁棒性和泛化能力。

Comments Version 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00780 2026-02-03 cs.AI 88%

Environment-Aware Adaptive Pruning with Interleaved Inference Orchestration for Vision-Language-Action Models

环境感知自适应剪枝与交错推断调度用于视觉-语言-动作模型

Yuting Huang, Leilei Ding, Zhipeng Tang, Zenghuan Zhu, Jiajun Deng, Xinrui Lin, Shuo Liu, Haojie Ren, Jianmin Ji, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.AI

AI总结 EcoVLA通过环境感知自适应剪枝和交错推断调度,实现视觉-语言-动作模型的高效参数稀疏化,提升推理速度并保持高成功率。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00686 2026-02-03 cs.RO 88%

Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching

通过自适应视觉令牌缓存学习加速视觉-语言-动作模型

Yujie Wei, Jiahan Fan, Jiyu Guo, Ruichen Zhen, Rui Shao, Xiu Su, Zeke Xie, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院) Central South University(中南大学) HKUST(GZ)(香港科技大学(广州))

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出通过自适应视觉令牌缓存学习加速VLA模型,提升推理效率并提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00500 2026-02-03 cs.RO 88%

Inject Once Survive Later: Backdooring Vision-Language-Action Models to Persist Through Downstream Fine-tuning

一次注入,后期存活:向视觉-语言-动作模型注入后门以在下游微调中持续存在

Jianyi Zhou, Yujie Wei, Ruichen Zhen, Bo Zhao, Xiaobo Xia, Rui Shao, Xiu Su, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院) Shanghai Jiaotong University(上海交通大学) National University of Singapore(新加坡国立大学) Central South University(中南大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出INFUSE框架,首次实现对VLA模型的后门攻击,使其在用户微调后仍能保持有效性,显著提升攻击成功率并保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01811 2026-02-03 cs.RO 83%

From Knowing to Doing Precisely: A General Self-Correction and Termination Framework for VLA models

从认知到精准执行:一种通用的自我校正与终止框架用于VLA模型

Wentao Zhang, Aolan Sun, Wentao Mo, Xiaoyang Qu, Yuxin Zheng, Jianzong Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司,深圳,中国)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出VLA-SCT框架,通过自我校正和终止机制提升VLA模型在抓取任务中的精度和鲁棒性,提高复杂环境下的执行可靠性。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02454 2026-02-03 cs.RO cs.AI 73%

World-Gymnast: Training Robots with Reinforcement Learning in a World Model

World-Gymnast: 在世界模型中用强化学习训练机器人

Ansh Kumar Sharma, Yixiang Sun, Ninghao Lu, Yunzhe Zhang, Jiarao Liu, Sherry Yang

机构 * New York University(纽约大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 World-Gymnast通过在世界模型中进行强化学习微调,有效提升真实机器人性能,比监督学习和软件模拟更具优势。

Comments https://world-gymnast.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00096 2026-02-03 cs.CV cs.AI 73%

Mirage2Matter: A Physically Grounded Gaussian World Model from Video

Mirage2Matter: 从视频构建一个物理基础的高斯世界模型

Zhengqing Gao, Ziwen Li, Xin Wang, Jiaxin Huang, Zhenyang Ren, Mingkai Shao, Hanlue Zhang, Tianyu Huang, Yongkang Cheng, Yandong Guo, Runqi Lin, Yuanyuan Wang, Tongliang Liu, Kun Zhang, Mingming Gong

机构 * MBZUAI AI$^2$Robotics(AI²Robotics) The University of Sydney(悉尼大学) Carnegie Mellon University(卡内基梅隆大学) The University of Melbourne(墨尔本大学)

专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 Mirage2Matter通过视频重建物理基础的世界模型,利用3D高斯点云和生成模型实现高保真具身训练数据生成,提升具身智能的可扩展性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00557 2026-02-03 cs.RO 70%

ConLA: Contrastive Latent Action Learning from Human Videos for Robotic Manipulation

ConLA:从人类视频中通过对比学习学习机器人操作

Weisheng Dai, Kai Lan, Jianyi Zhou, Bo Zhao, Xiu Su, Junwen Tong, Weili Guan, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) State Key Laboratory of Mobile Network and Mobile Multimedia Technology, Shenzhen(移动网络与移动多媒体技术国家重点实验室(深圳)) ZTE Corporation(中兴通讯) Shanghai Jiao Tong University(上海交通大学) Central South University(中南大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 ConLA通过对比学习从人类视频中学习机器人操作,有效解决潜在表示中的捷径学习问题,提升机器人学习的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01643 2026-02-03 cs.LG cs.AI 62%

De Novo Molecular Generation from Mass Spectra via Many-Body Enhanced Diffusion

从质谱数据生成新分子结构的多体增强扩散

Xichen Sun, Wentao Wei, Jiahua Rao, Jiancong Xie, Yuedong Yang

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 MBGen通过多体增强扩散框架,利用质谱数据生成新分子结构,显著提升异构体区分和复杂碎片化机制的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06062 2026-02-03 cs.LG cs.DC 57%

Resolving Extreme Data Scarcity by Explicit Physics Integration: An Application to Groundwater Heat Transport

通过显式物理整合解决极端数据稀缺问题:应用于地下水热传输的应用

Julia Pelzer, Corné Verburg, Alexander Heinlein, Miriam Schulte

机构 * Institute for Parallel and Distributed Systems, University of Stuttgart, Stuttgart, Germany(并行与分布式系统研究所,斯图加特大学,斯图加特,德国) Delft Institute of Applied Mathematics, Delft University of Technology (TU Delft), Delft, the Netherlands(代尔夫特应用数学研究所,代尔夫特理工大学(TU Delft),代尔夫特,荷兰)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出了一种局部-全局卷积神经网络,通过显式物理整合解决极端数据稀缺问题,应用于地下水热传输建模,展示了其在城市尺度和实际地下参数地图上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01647 2026-02-03 astro-ph.HE astro-ph.GA 50%

A Serendipitous NuSTAR Detection of a Giant Radio Source Harboring an Obscured Active Galactic Nucleus

偶然发现的NuSTAR探测到一个拥有被遮蔽活动星系核的巨型射电源

Vaidehi S. Paliya, S. Marchesi, X. Zhao, D. J. Saikia, Moumita Pal, Somak Raychaudhury

专题命中 VLA模型 :VLA(abstract)

AI总结 该研究通过多波段观测发现了一个被遮蔽的活动星系核,其具有陡峭的射电光谱和低核心主导性,证实其为类型II AGN。

Comments ApJ, in press

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17886 2026-02-03 hep-ph 50%

The role of charm and unflavored mesons in prompt atmospheric lepton fluxes

重子和无味介子在瞬时大气轻子通量中的作用

Laksha Pradip Das, Diksha Garg, Maria Vittoria Garzelli, Mary Hall Reno, Günter Sigl

专题命中 VLA模型 :action model(abstract)

AI总结 本文研究了固有charm成分对瞬时大气轻子通量的影响,并探讨了通过调整无味介子贡献以解决测量与预测之间的不一致。

Comments 28 pages, 20 figures, 3 tables, Note: Version 2 includes results that account for December 2025 IceCube limits on the prompt atmospheric muon neutrino flux

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04056 2026-02-03 q-bio.PE 50%

Generalized Lotka-Volterra systems with quenched random interactions and saturating nonlinear response

具有淬火随机相互作用和饱和非线性响应的广义洛特卡-沃尔terra系统

Marco Zenari, Francesco Ferraro, Sandro Azaele, Amos Maritan, Samir Suweis

专题命中 VLA模型 :action model(abstract)

AI总结 本文通过引入饱和非线性响应,改进了广义洛特卡-沃尔terra系统以抑制无界增长,并揭示了无序生态系统中非线性与对称性对多样性与韧性的影响。

Journal ref Physical Review E 00, 004200 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏