arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9893 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9209 篇

2512.00783 2026-01-23 cs.LG cs.RO 90%

Sigma: The Key for Vision-Language-Action Models toward Telepathic Alignment

Sigma:迈向心电图对齐的视觉-语言-动作模型的关键

Libo Wang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 Sigma模型通过整合深度语义理解和关联推理,实现了感知与动作的心电图式对齐,无需重新训练基础模型,提升了语义对齐和意图驱动行为的可重复性。

Comments The Sigma model has been open-sourced on Hugging Face. Weights, dataset, some scripts, and logs are all available. The link is: https://huggingface.co/Veltraxor/Sigma

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09527 2026-01-12 cs.CV cs.AI 90%

CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games

CombatVLA: 一种高效的视觉-语言-动作模型,用于3D动作角色扮演游戏中的战斗任务

Peng Chen, Pi Bu, Yingyao Wang, Xinyi Wang, Ziming Wang, Jie Guo, Yingxiu Zhao, Qi Zhu, Jun Song, Siran Yang, Jiamang Wang, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 CombatVLA是一种高效的视觉-语言-动作模型,用于3D动作角色扮演游戏中的战斗任务,通过高效的训练和推理方法,在战斗理解基准上表现优异,并实现了游戏战斗的50倍加速。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15411 2025-12-22 cs.RO cs.CV 90%

MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training

MiVLA:迈向具有人机互模仿预训练的通用视觉-语言-动作模型

Zhenhan Yin, Xuanhan Wang, Jiahao Jiang, Kaiyuan Deng, Pengqi Chen, Shuangle Li, Chong Liu, Xing Xu, Jingkuan Song, Lianli Gao, Heng Tao Shen

机构 * Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 MiVLA通过人机互模仿预训练,提升视觉-语言-动作模型在现实与模拟环境中的泛化能力,实验显示其在模拟和现实任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16203 2025-12-12 cs.CV cs.AI 90%

When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models

当对齐失败时:针对视觉-语言-动作模型的多模态对抗攻击

Yuping Yan, Yuhan Xie, Yixin Zhang, Lingjuan Lyu, Handing Wang, Yaochu Jin

机构 * TGAI Lab, School of Engineering, Westlake University(西拉库大学工程学院TGAI实验室) Pennsylvania State University(宾夕法尼亚州立大学) Sony Research, Sony(索尼研究实验室,索尼) Xidian University(西安电子科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLA-Fool,针对视觉-语言-动作模型的多模态对抗攻击,揭示其在白盒和黑盒环境下具身多模态对齐的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15201 2025-11-13 cs.RO cs.AI 90%

Survey of Vision-Language-Action Models for Embodied Manipulation

Haoran Li, Yuhui Chen, Wenbo Cui, Weiheng Liu, Kai Liu, Mingcai Zhou, Zhengtao Zhang, Dongbin Zhao

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments in Chinese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19752 2025-10-23 cs.RO cs.AI 90%

Learning Affordances at Inference-Time for Vision-Language-Action Models

Ameesh Shah, William Chen, Adwait Godbole, Federico Mora, Sanjit A. Seshia, Sergey Levine

机构 * UC Berkeley(伯克利大学) Physical Intelligence(物理智能)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments 7 pages and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04246 2025-10-07 cs.RO cs.AI 90%

ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context

Huiwon Jang, Sihyun Yu, Heeseung Kwon, Hojin Jeon, Younggyo Seo, Jinwoo Shin

机构 * KAIST(韩国科学技术院) RLWRLD UC Berkeley(伯克利大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments Project page: https://huiwon-jang.github.io/contextvla

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21986 2025-09-29 cs.RO cs.AI 90%

Developing Vision-Language-Action Model from Egocentric Videos

Tomoya Yoshida, Shuhei Kurita, Taichi Nishimura, Shinsuke Mori

机构 * Kyoto University(京都大学) National Institute of Informatics(国家信息研究所) Institute of Science Tokyo(东京科学研究所) NII LLMC(日本信息机构语言模型中心) Sony Interactive Entertainment(索尼互动娱乐)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06932 2025-09-11 cs.RO cs.CV 90%

LLaDA-VLA: Vision Language Diffusion Action Models

Yuqing Wen, Hebei Li, Kefan Gu, Yucheng Zhao, Tiancai Wang, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Dexmal Project Page(Dexmal项目页)

专题命中 VLA模型 :VLA(title,abstract);action model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19850 2025-06-25 cs.CV cs.RO 90%

Unified Vision-Language-Action Model

Yuqi Wang, Xinghang Li, Wenxuan Wang, Junbo Zhang, Yingyan Li, Yuntao Chen, Xinlong Wang, Zhaoxiang Zhang

机构 * CASIA(中国科学院自动化研究所) BAAI(阿里巴巴人工智能研究院) THU(清华大学) HKISI(香港理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03350 2025-06-05 cs.RO cs.AI 90%

Adversarial Attacks on Robotic Vision Language Action Models

Eliot Krzysztof Jones, Alexander Robey, Andy Zou, Zachary Ravichandran, George J. Pappas, Hamed Hassani, Matt Fredrikson, J. Zico Kolter

专题命中 VLA模型 :action model(title,abstract);vision language action(title);vision-language-action(abstract);VLA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12514 2025-05-14 cs.RO cs.CV 90%

TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation

Junjie Wen, Yichen Zhu, Jinming Li, Minjie Zhu, Kun Wu, Zhiyuan Xu, Ning Liu, Ran Cheng, Chaomin Shen, Yaxin Peng, Feifei Feng, Jian Tang

机构 * East China Normal University(东华师范大学) Midea Group, AI Lab(美的集团人工智能实验室) Syracuse University(雪城大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Shanghai University(上海大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

Comments add more citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04453 2025-02-18 cs.RO cs.CV 90%

NaVILA: Legged Robot Vision-Language-Action Model for Navigation

An-Chieh Cheng, Yandong Ji, Zhaojing Yang, Zaitian Gongye, Xueyan Zou, Jan Kautz, Erdem Bıyık, Hongxu Yin, Sifei Liu, Xiaolong Wang

机构 * UC San Diego(加州大学圣迭戈分校) USC(南加州大学) NVIDIA(英伟达公司)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

Comments Website: https://navila-bot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05248 2026-06-16 cs.RO 版本更新 90%

LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model

LaST$_{0}$:面向机器人视觉-语言-动作模型的潜在时空思维链

Zhuoyang Liu, Jiaming Liu, Hao Chen, Jiale Yu, Ziyu Guo, Chengkai Hou, Chenyang Gu, Xiangju Mi, Renrui Zhang, Kun Wu, Zhengping Che, Jian Tang, Pheng-Ann Heng, Shanghang Zhang

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出LaST$_0$框架,通过潜在时空思维链在隐空间进行高效推理,避免显式推理的延迟和语言瓶颈,在10个真实世界任务中平均成功率提升13%-14%。

Comments Project page: https://vla-last0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16056 2026-05-18 cs.RO 90%

Health-Conditioned Vision-Language-Action Models for Malfunction-Aware Robot Control

面向故障感知的视觉-语言-动作模型用于机器人故障-aware 控制

Hüseyin Arslan, Özgür Erkent

机构 * Computer Engineering, Hacettepe University, Ankara, Turkey(哈切特佩大学计算机工程系,安卡拉,土耳其)

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract,abstract_cn);vision language action(abstract)

AI总结 本文提出一种故障感知的视觉-语言-动作模型,通过引入健康投影模块,使机器人在关节退化等物理故障情况下仍能完成任务。

Comments VLA Pipelines Workshop at IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17439 2026-03-11 cs.RO cs.AI cs.CV cs.LG 90%

From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors

从空间到动作:在空间先验基础上构建视觉-语言-动作模型

Zhengshen Zhang, Hao Li, Yalun Dai, Zhengbang Zhu, Lei Zhou, Chenchen Liu, Dong Wang, Francis E. H. Tay, Sijin Chen, Ziwei Liu, Yuxiao Liu, Xinghang Li, Pan Zhou

机构 * ByteDance Seed(字节跳动种子) NUS(新加坡国立大学) NTU(国立技术大学) THU(清华大学) SMU(南方大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV、cs.AI

AI总结 FALCON通过引入丰富的3D空间标记,改进了视觉-语言-动作模型的空间表示、模态可转移性和对齐能力,在多个基准和现实任务中取得最佳性能。

Comments Accepted at ICLR 2026. Project page: https://falcon-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05049 2026-02-06 cs.CV cs.AI cs.LG cs.RO 90%

VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models

VISTA: 通过视觉跟踪偏好优化增强视觉条件化在视觉-语言-动作模型中

Yiye Chen, Yanan Jian, Xiaoyi Dong, Shuxin Cao, Jing Wu, Patricio Vela, Benjamin E. Lundell, Dongdong Chen

机构 * Nvidia(Nvidia公司) Microsoft(微软公司) University of Oxford(牛津大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV、cs.AI

AI总结 VISTA通过视觉跟踪偏好优化提升视觉条件化,增强VLA模型在视觉-动作对齐和任务性能上的表现。

Comments In submission. Project website: https://vista-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07077 2025-10-09 cs.RO cs.AI cs.CV cs.LG 90%

Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications

Kento Kawaharazuka, Jihoon Oh, Jun Yamada, Ingmar Posner, Yuke Zhu

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学计算机科学系)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV、cs.AI

Comments Accepted to IEEE Access, website: https://vla-survey.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11417 2025-09-18 cs.RO cs.AI cs.CV cs.LG 90%

Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations

Shresth Grover, Akshay Gopalkrishnan, Bo Ai, Henrik I. Christensen, Hao Su, Xuanlin Li

机构 * UC San Diego(圣迭戈大学) Hillbot

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV、cs.AI

Comments Project Page: https://gen-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17016 2025-05-23 cs.LG cs.AI cs.CV cs.RO 90%

Interactive Post-Training for Vision-Language-Action Models

Shuhan Tan, Kairan Dou, Yue Zhao, Philipp Krähenbühl

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV、cs.AI

Comments Project page: https://ariostgx.github.io/ript_vla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26243 2026-08-28 astro-ph.HE 新提交 89%

Radio Monitoring of the Changing-look AGN Mrk 590 I: VLA Observations Reveal A Bow-shock Driven Radio Brightening Event

变貌活动星系核 Mrk 590 的射电监测 I:甚大阵(VLA)观测揭示弓激波驱动的射电增亮事件

Gregory Walsh, Marianne Vestergaard, Daniel Lawther, Sandra Raimundo, Jun Yi Koay

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 本研究通过VLA观测发现,变貌AGN Mrk 590的射电增亮由弓激波驱动,其射电变异性与高能波段的吸积变事件无关联,揭示了变貌AGN行为机制的多样性。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18275 2026-08-20 astro-ph.IM 新提交 89%

The VLA and High-Frequency SETI: Expanding the Search for Life

VLA与高频SETI:拓展地外生命搜寻

Talon Myburgh, Noah Stiegler, Chenoa D. Tremblay, Joe S. Bright, Ross A. Donnachie

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 本研究依托VLA的COSMIC系统,运用泰勒树去色散算法搜寻高频窄带漂移技术信号,扩展了SETI的高频搜寻范围。

Comments 15 pages, 8 figures, 4 tables. In press in Acta Astronautica (Special Issue: 76th IAC). Presented at the 76th International Astronautical Congress (IAC 2025), Paper IAC-25-A4,1,6,x95796

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05453 2026-08-07 astro-ph.GA astro-ph.SR 新提交 89%

The Zero-Age Massive Stellar Population of W49A from VLA Observations

基于VLA观测的W49A零龄大质量恒星群

M. Juárez-Gama, R. Galván-Madrid, G. Suárez, C. G. De Pree, J. J. Tobin, G. Bruzual, A. Ginsburg, J. E. Mendoza-Torres, H. B. Liu, D. Wilner, T. Nony, A. Parra-López, R. Rivera-Soto, A. F. McLeod, N. Cunningham, X. Lu, E. F. Jiménez-Andrade

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 该研究利用VLA观测数据推断W49A原星团的零龄大质量恒星群,通过方法推导恒星参数,发现其大质量端IMF斜率与标准IMF存在差异,提出相关可能原因。

Comments Resubmitted to the AAS Journals following the second referee report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14236 2026-07-17 cs.RO cs.AI cs.LG 新提交 89%

Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection

力,永不嫌迟:通过反应式力注入加速视觉-语言-动作模型的训练后优化

Yi Wang, Wendi Chen, Zimo Wen, Han Xue, Xueqi Li, Wenye Yu, Zhijie Chen, Hao Yang, Jun Lv, Chuan Wen, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Noematrix Ltd.(诺玛矩阵有限公司)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究针对预训练VLA策略在接触状态下表现不佳的问题,提出LIFT框架,通过嫁接反应式动作专家、注入力及结合在线DAgger循环,提升其在富含接触操作任务中的性能,且证明相关组件对稳健操作很重要。

Comments Project page: https://lift-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11324 2026-07-14 cs.RO cs.AI cs.LG 版本更新 89%

Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

Embodied-R1.5:通过具身基础模型演化物理智能

Yifu Yuan, Yaoting Huang, Xianze Yao, Yutong Li, Shuoheng Zhang, Linqi Han, Pengyi Li, Jiangeng Sun, Wenting Jia, Zhao Zhang, Yuhao Liu, Ruihao Liao, Yucheng Hu, Qiyu Wu, Yuxiao Li, Zibin Dong, Fei Ni, Yan Zheng, Shuyang Gu, Yi Ma, Hongyao Tang, Han Hu, Jianye Hao

机构 * Tianjin University(天津大学) Tencent Hunyuan(腾讯混元)

专题命中 VLA模型 :VLA(summary_cn,abstract);embodied foundation model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出统一具身基础模型Embodied-R1.5,通过自动化数据管道和多任务平衡强化学习,在8B参数下实现24项基准中16项最优,并支持微调为VLA模型。

Comments Embodied R1.5 technical report. Project page: https://embodied-r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05116 2026-07-09 cs.CV cs.AI cs.RO 版本更新 89%

VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting

VOTE:基于轨迹集成投票的视觉-语言-动作优化

Juyi Lin, Amir Taherin, Arash Akbari, Arman Akbari, Lei Lu, Guangyu Chen, Taskin Padir, Xiaomeng Yang, Weiwei Chen, Yiqian Li, Xue Lin, David Kaeli, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Cisco(思科) EmbodyX

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);vision language action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 针对VLA模型生成令牌多、动作利用不足的问题,开发训练框架微调模型减少令牌生成,引入基于投票的集成策略优化推理,相比现有模型性能更优,推理更快,证明了实际可部署性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19710 2026-07-08 cs.CV cs.LG cs.RO 版本更新 89%

PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies

面向通用视觉-语言-动作策略的通用姿态预训练

Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, Yanwei Fu

机构 * Tencent Robotics X(腾讯机器人X) Futian Laboratory(福田实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA

Journal ref Robotics: Science and Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00666 2026-07-02 cs.RO cs.CV cs.LG 新提交 89%

Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts

域算术:环境变化下的单次VLA适应

Taewook Kang, Taeheon Kim, Donghyun Shin, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出域算术(DART)方法,通过权重向量算术和子空间对齐,仅需单次演示即可适应环境变化,在视觉和实体变化场景下优于现有方法。

Comments ECCV 2026. Project page: https://twkang43.github.io/projects/dart

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12043 2026-06-17 astro-ph.HE 89%

Mapping the emission and spectral properties of the FRI radio galaxy 3C 449 with LOFAR and the VLA

用LOFAR和VLA测绘FRI射电星系3C 449的发射和光谱特性

Luca Ricci, Luisa Ostorero, Raffaella Morganti, Judith H. Croston, Martin J. Hardcastle, Timothy W. Shimwell

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 通过结合LOFAR和VLA数据,研究3C 449射电星系的射电发射和光谱特性,揭示其喷流和羽翼的演化过程及粒子加速机制。

Comments 26 pages, 37 figures, accepted for publication in A&A

Journal ref A&A 710, A214 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13733 2026-06-11 cs.LG cs.AI cs.RO 版本更新 89%

Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents

视觉-语言-动作跳跃启动用于强化学习机器人智能体

Angelo Moroncelli, Roberto Zanetti, Marco Maccarini, Loris Roveda

机构 * University of Applied Science and Arts of Southern Switzerland, Department of Innovative Technologies(瑞士南方应用科学与艺术大学创新技术系) Università della Svizzera Italiana, Faculty of Informatics, Lugano, Switzerland(瑞士意大利大学信息学院,卢加诺,瑞士)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出VLAJS方法,通过稀疏的VLA高层动作建议引导PPO探索,结合方向性动作一致性正则化,提升强化学习在长时域操作任务中的样本效率,并在仿真和真实机器人上验证。

Comments ICRA 2026 Workshop on Reinforcement Learning in the Era of Imitation Learning

详情

展开后加载摘要…

URL PDF HTML 收藏