arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9157 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9157 篇

2606.20781 2026-06-23 cs.RO cs.CV 新提交 84%

World Action Models: A Survey

世界行动模型:综述

Qiuhong Shen, Shihua Zhang, Yue Liao, Qi Li, Zhenxiong Tan, Shizun Wang, Shuicheng Yan, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文综述世界行动模型(WAMs),通过两种互补视角组织现有工作,揭示其设计权衡与未来趋势。

Comments 57 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08107 2026-06-09 cs.RO cs.AI 新提交 84%

Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data

Ego-Pi: 面向自我中心人类与机器人数据的VLA微调

Ji Woong Kim, Ke Wang, Zipeng Fu, Sirui Chen, Cong Zhao, Jeff Lai, Chelsea Finn

机构 * Stanford University(斯坦福大学) Meta

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.AI

AI总结 为解决机器人数据稀缺问题,利用自我中心人类数据,基于π₀.₅模型微调,使机器人学习新任务语义并组合现有技能,无需对应机器人数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15964 2026-05-18 cs.RO cs.CV 84%

WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation

WorldVLN: 用于空域视觉-语言导航的自回归世界动作模型

Baining Zhao, Jiacheng Xu, Weicheng Feng, Xin Zhang, Zhaolu Wang, Haoyang Wang, Shilong Ji, Ziyou Wang, Jianjie Fang, Zhiheng Zheng, Weichen Zhang, Yu Shang, Wei Wu, Chen Gao, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) Shandong University(山东大学) Manifold AI Beijing Institute of Technology(北京理工大学) Northeastern University(东北大学)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 WorldVLN提出一种自回归世界动作模型,通过预测潜在世界演变并生成可执行的航点动作,提升空域视觉-语言导航性能,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12160 2026-05-13 cs.RO cs.AI 84%

Premover: Fast Vision-Language-Action Control by Acting Before Instructions Are Complete

Premover: 通过在指令完成前行动实现快速的视觉-语言-动作控制

Joonha Park, Jiseung Jeong, Taesik Gong

机构 * UNIST(全南大学) The Catholic University of Korea(韩国天主教大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 Premover通过在用户指令完成前进行预计算,减少机器人交互时间,同时保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23001 2026-04-28 cs.RO cs.AI 84%

Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines

机器人中的视觉-语言-动作:数据集、基准和数据引擎的综述

Ziyao Wang, Bingying Wang, Hanrong Zhang, Tingting Du, Tianyang Chen, Guoheng Sun, Yexiao He, Zheyu Shen, Wanghao Ye, Ang Li

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Utah(犹他大学) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 VLA模型 :vision-language-action(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文综述了视觉-语言-动作研究中数据基础设施的关键挑战,指出未来进展依赖于数据引擎与评估协议的协同设计,揭示了数据集、基准和数据引擎的四大开放挑战。

Comments This is a survey paper. The survey is already accepted by TMLR after peer-review. The OpenReview link is here: https://openreview.net/forum?id=tAaWFpvnmm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11236 2026-04-15 cs.CV cs.CL cs.RO 84%

ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning

ABot-M0:基于动作流形学习的机器人操控VLA基础模型

Yandan Yang, Shuang Zeng, Tong Lin, Xinyuan Chang, Dekang Qi, Junjin Xiao, Haoyun Liu, Ronghan Chen, Yuzhi Chen, Dongjie Huo, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

机构 * AMAP CV Lab(AMAP视觉实验室)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.CV

AI总结 ABot-M0通过统一预训练和动作流形学习,提升机器人操控的泛化能力与效率,构建了大规模数据集并支持模块化感知。

Comments Project website: https://amap-cvlab.github.io/ABot-Manipulation/ . Code: https://github.com/amap-cvlab/ABot-Manipulation . 22 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09059 2026-04-13 cs.CV cs.AI 84%

Learning Vision-Language-Action World Models for Autonomous Driving

学习视觉-语言-动作世界模型以实现自动驾驶

Guoqing Wang, Pin Tang, Xiangxuan Ren, Guodongfang Zhao, Bailan Feng, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) Central Research Institute, Huawei(华为中央研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLA-World模型,通过结合预测想象与反思推理提升自动驾驶的前瞻性。该模型利用生成的轨迹引导图像生成,并通过反思优化轨迹预测,实验表明其在规划和未来场景生成任务中优于现有方法。

Comments Accepted by CVPR2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16811 2026-04-08 cs.CV cs.RO 84%

GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation

GeoPredict: 借助预测运动学和3D高斯几何实现精确VLA操作

Jingjing Qian, Boyao Han, Chen Shi, Lei Xiao, Long Yang, Shaoshuai Shi, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hunan University(湖南大学) Voyager Research, Didi Chuxing(滴滴出行沃歌研究)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 GeoPredict通过引入轨迹级模块和预测3D高斯几何模块,提升VLA模型在3D空间推理中的精度,实验表明其在几何密集和空间要求高的任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01723 2026-04-03 cs.RO cs.AI 84%

Causal Scene Narration with Runtime Safety Supervision for Vision-Language-Action Driving

基于运行时安全监督的因果场景叙述用于视觉-语言-动作驾驶

Yun Li, Yidu Zhang, Simon Thompson, Ehsan Javanmardi, Manabu Tsukada

机构 * Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) TIER IV, Inc.(TIER IV 公司)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出CSN方法,通过意图约束对齐、定量 grounding 和结构分离重构VLA文本输入,提升驾驶评分并增强安全性。

Comments 18 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27287 2026-03-31 cs.RO cs.CV 84%

Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving

Uni-World VLA:自主驾驶中的交织世界建模与规划

Qiqi Liu, Huan Xu, Jingyu Li, Bin Sun, Zhihui Hao, Dangen She, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Li Auto Inc.(理想汽车) University of Surrey(萨里大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Uni-World VLA模型,通过交织未来帧预测与轨迹规划提升自主驾驶决策能力,结合单目深度信息增强场景预测。

Comments 22 pages, 8 figures. Submitted to ECCV 2026. Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05982 2026-03-09 cs.RO cs.CV 84%

HarvestFlex: Strawberry Harvesting via Vision-Language-Action Policy Adaptation in the Wild

HarvestFlex: 通过视觉-语言-动作策略适应实现草莓采摘

Ziyang Zhao, Shuheng Wang, Zhonghua Miao, Ya Xiong

机构 * The Intelligent Equipment Research Center, Beijing Academy of Agriculture and Forestry Sciences(北京农业与林业科学研究院智能装备研究所) The School of Mechanical Electrical Engineering and Automation, Shanghai University(上海大学机械电子工程与自动化学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 HarvestFlex通过视觉-语言-动作策略适应,在真实温室中实现了高效草莓采摘,成功率达74%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02271 2026-03-04 cs.PF cs.AI cs.AR cs.RO 84%

Characterizing VLA Models: Identifying the Action Generation Bottleneck for Edge AI Architectures

表征VLA模型:识别边缘AI架构中的动作生成瓶颈

Manoj Vishwanathan, Suvinay Subramanian, Anand Raghunathan

机构 * Google, Mountain View, CA(谷歌,山景城,加利福尼亚) Purdue University, West Lafayette, IN(普渡大学,沃斯堡,印第安纳)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文研究了VLA模型在边缘AI中的动作生成瓶颈,通过分析发现动作生成阶段占端到端延迟的75%,并探讨了扩展至100B参数模型的硬件需求及未来技术路径。

Comments 3 Pages 4 Figures for Workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17520 2026-03-04 cs.RO cs.CV 84%

InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation

InstructVLA: 从理解到操作的视觉-语言-动作指令微调

Shuai Yang, Hao Li, Bin Wang, Yilun Chen, Yang Tian, Tai Wang, Hanqing Wang, Feng Zhao, Yiyi Liao, Jiangmiao Pang

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 InstructVLA通过视觉-语言-动作指令微调,实现了在多模态推理和动作生成之间的平衡,提升了机器人在复杂任务中的操控性能和泛化能力。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01490 2026-03-03 cs.CV cs.AI 84%

ATA: Bridging Implicit Reasoning with Attention-Guided and Action-Guided Inference for Vision-Language Action Models

ATA:通过注意力引导和动作引导推理桥接隐式推理用于视觉-语言-动作模型

Cheng Yang, Jianhao Jiao, Lingyi Huang, Jinqi Xiao, Zhexiang Tang, Yu Gong, Yibiao Ying, Yang Sui, Jintian Lin, Wen Huang, Bo Yuan

机构 * Rutgers University(罗格斯大学) University College London(伦敦大学学院) Rice University(Rice大学) TCL High-Tech Development Co., Ltd.(TCL高科技发展有限公司)

专题命中 VLA模型 :action model(title);vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 ATA提出了一种无需训练的隐式推理框架,通过注意力引导和动作引导策略提升视觉-语言-动作模型的任务成功率和鲁棒性,同时保持高效推理。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01469 2026-03-03 cs.RO cs.AI 84%

Mean-Flow based One-Step Vision-Language-Action

基于均流的单步视觉-语言-动作

Yang Chen, Xiaoguang Ma, Bin Zhao

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于均流的单步VLA方法,通过消除传统流匹配方法的一致性约束,显著提升生成效率,实现实时动作生成,实验表明其在机器人操作中的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22514 2026-02-27 cs.RO cs.AI cs.SY eess.SY 84%

SignVLA: A Gloss-Free Vision-Language-Action Framework for Real-Time Sign Language-Guided Robotic Manipulation

SignVLA:一种无 gloss 的视觉-语言-动作框架,用于实时 sign language 引导的机器人操作

Xinyu Tan, Ningwei Bai, Harry Gardener, Zhengyang Zhong, Luoyu Zhang, Liuhaichen Yang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

机构 * Department of Computer Science, University College London (UCL)(计算机科学系,伦敦大学学院(UCL))

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 SignVLA 提出了一种无 gloss 的视觉-语言-动作框架,用于实时手语引导的机器人操作,通过几何归一化、时间平滑和词汇精炼提升多模态交互的稳定性和可扩展性。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18224 2026-02-23 cs.RO cs.LG 84%

SimVLA: A Simple VLA Baseline for Robotic Manipulation

SimVLA:一种简单的VLA基线用于机器人操作

Yuankai Luo, Woping Chen, Tong Liang, Baiqiao Wang, Zhenguo Li

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 SimVLA通过简化设计实现了最先进的机器人操作性能,展示了最小参数模型在模拟和真实环境中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12281 2026-02-19 cs.RO cs.AI cs.SY eess.SY 84%

Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment

在视觉-语言-动作对齐中,验证比策略学习更具效率

Jacky Kwok, Xilun Zhang, Mengdi Xu, Yuejiang Liu, Azalia Mirhoseini, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) NVIDIA Research(NVIDIA研究)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出CoVer-VLA验证方法,通过测试时验证在视觉-语言-动作对齐中实现22%的在分布和13%的分布外收益,同时在现实世界实验中进一步提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12322 2026-02-16 cs.RO cs.AI 84%

ForeAct: Steering Your VLA with Efficient Visual Foresight Planning

ForeAct: 通过高效的视觉前瞻性规划控制您的VLA

Zhuoyang Zhang, Shang Yang, Qinghao Hu, Luke J. Huang, James Hou, Yufei Sun, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) Caltech(加州理工学院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 ForeAct通过高效的视觉前瞻性规划提升VLA在开放环境中的执行精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11832 2026-02-13 cs.CV cs.RO 84%

JEPA-VLA: Video Predictive Embedding is Needed for VLA Models

视频预测嵌入对于VLA模型是必要的

Shangchen Miao, Ningya Feng, Jialong Wu, Ye Lin, Xu He, Dong Li, Mingsheng Long

机构 * Tsinghua University(清华大学) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 JEPA-VLA通过引入视频预训练的预测嵌入,提升VLA模型在机器人任务中的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22208 2026-02-05 cs.CL cs.CV cs.LG 84%

Open-Source Multimodal Moxin Models with Moxin-VLM and Moxin-VLA

开源多模态Moxin模型:Moxin-VLM和Moxin-VLA

Pu Zhao, Arash Akbari, Xuan Shen, Zhenglun Kong, Yixin Shen, Sung-En Chang, Timothy Rupprecht, Lei Lu, Enfu Nan, Changdi Yang, Yumei He, Weiyan Shi, Xingchen Xu, Yu Huang, Wei Jiang, Wei Wang, Yue Chen, Yong He, Yanzhi Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Futurewei(未来通信) AIBAO LLC

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.CV、cs.LG

AI总结 本文提出开源多模态Moxin模型,通过Moxin-VLM、Moxin-VLA和Moxin-Chinese三种变体,提升视觉-语言、视觉-语言-动作及中文任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20966 2026-01-30 cs.RO cs.AI 84%

Parallels Between VLA Model Post-Training and Human Motor Learning: Progress, Challenges, and Trends

VLA模型后训练与人类运动学习的类比:进展、挑战与趋势

Tian-Yu Xiang, Ao-Qun Jin, Xiao-Hu Zhou, Mei-Jiang Gui, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Sheng-Bin Duan, Fu-Chao Xie, Wen-Kai Wang, Si-Cheng Wang, Ling-Yun Li, Tian Tu, Zeng-Guang Hou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Grainger College of Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院) CAS Center for Excellence in Brain Science and Intelligence Technology(中国科学院脑科学与智能技术卓越创新中心) Joint Laboratory of Intelligence Science and Technology, Institute of Systems Engineering, Macau University of Science and Technology(澳门科技大学系统工程学院智能科学与技术联合实验室)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文从人类运动学习角度综述了VLA模型后训练的进展、挑战与趋势,提出四类后训练方法并探讨了其在机器人操作中的应用与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13809 2026-01-22 cs.RO cs.AI 84%

DroneVLA: VLA based Aerial Manipulation

DroneVLA:基于VLA的空中操控

Fawad Mehboob, Monijesu James, Amir Habel, Jeffrin Sam, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skoltech(斯克里普金科技大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 DroneVLA通过结合VLA模型和定制无人机,实现基于自然语言指令的空中物体抓取与递送,展示了在定位和导航中的高精度表现。

Comments This paper has been accepted for publication at LBR of HRI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06451 2026-01-13 cs.RO cs.CV 84%

CulinaryCut-VLAP: A Vision-Language-Action-Physics Framework for Food Cutting via a Force-Aware Material Point Method

CulinaryCut-VLAP:一种用于通过力感知材料点方法进行食物切割的视觉-语言-动作-物理框架

Hyunseo Koh, Chang-Yong Song, Youngjae Choi, Misa Viveiros, David Hyde, Heewon Kim

机构 * Soongsil University(Soongsil大学) Vanderbilt University(范德比大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 CulinaryCut-VLAP通过力感知材料点方法构建视觉-语言-动作-物理框架,实现对食物切割的物理真实模拟与高效训练。

Comments 16 pages; 15 figures; 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24673 2026-01-01 cs.RO cs.AI cs.SY eess.SY 84%

VLA-RAIL: A Real-Time Asynchronous Inference Linker for VLA Models and Robots

VLA-RAIL:一种用于VLA模型和机器人的实时异步推理链接器

Yongsheng Zhao, Lei Zhao, Baoping Cheng, Gongxin Yao, Xuanzhang Wen, Han Gao

机构 * China Mobile (Hangzhou) Information Technology Co., Ltd.(中国移动(杭州)信息技术有限公司)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 VLA-RAIL通过异步推理和轨迹平滑技术,提升机器人动作执行的连续性和速度,提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20188 2025-12-24 cs.RO cs.AI 84%

Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation

异步快速-慢速视觉-语言-动作策略用于全身机器人操作

Teqiang Zou, Hongliang Zeng, Yuxuan Nong, Yifan Li, Kehui Liu, Haotian Yang, Xinyang Ling, Xin Li, Lianyang Ma

机构 * AstriBot Team(AstriBot团队)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 DuoCore-FS通过异步快速-慢速框架提升全身机器人操作的实时性能与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10008 2025-12-22 cs.RO cs.AI 84%

Phantom Menace: Exploring and Enhancing the Robustness of VLA Models Against Physical Sensor Attacks

幻影威胁:探索和增强VLA模型对物理传感器攻击的鲁棒性

Xuancun Lu, Jiaxiang Chen, Shilin Xiao, Zizhi Jin, Zhangrui Chen, Hanwen Yu, Bohan Qian, Ruochen Zhou, Xiaoyu Ji, Wenyuan Xu

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种新型框架,用于研究和增强VLA模型对物理传感器攻击的鲁棒性,并开发了对抗训练方法以提升模型安全性。

Comments Accepted by AAAI 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00139 2025-12-16 cs.RO cs.AI 84%

End-to-End Dexterous Arm-Hand VLA Policies via Shared Autonomy: VR Teleoperation Augmented by Autonomous Hand VLA Policy for Efficient Data Collection

端到端的灵活臂-手VLA策略通过共享自主性:通过自主手VLA策略增强的VR远程操作用于高效数据收集

Yu Cui, Yujian Zhang, Lina Tao, Yang Li, Xinyu Yi, Zhibin Li

机构 * ByteDance(字节跳动)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种共享自主框架,通过结合VR远程操作和自主手VLA策略,实现高效的数据收集,从而训练端到端的VLA策略以提升机器人灵活操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11218 2025-12-15 cs.RO cs.CV 84%

Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy

视觉与语言动作政策的贝叶斯分解:看见以行动,提示以指定

Kechun Xu, Zhenjie Zhu, Anzhe Chen, Shuqi Zhao, Qing Huang, Yifei Yang, Haojian Lu, Rong Xiong, Masayoshi Tomizuka, Yue Wang

机构 * Zhejiang University(浙江大学) UC Berkeley(伯克利大学)

专题命中 VLA模型 :vision language action(title);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出BayesVLA,通过贝叶斯分解策略,解决VLA模型中因模态不平衡导致的灾难性遗忘问题,提升泛化能力和指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03724 2025-12-09 cs.CV cs.RO 84%

PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention

PosA-VLA: 通过姿态条件化锚点注意力增强动作生成

Ziwen Li, Xin Wang, Hanlue Zhang, Runnan Chen, Runqi Lin, Xiao He, Han Huang, Yandong Guo, Fakhri Karray, Tongliang Liu, Mingming Gong

机构 * MBZUAI AI2 Robotics The University of Sydney(悉尼大学) The University of Melbourne(墨尔本大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 PosA-VLA通过姿态条件化锚点注意力机制提升动作生成的精度和效率,适用于多样化的机器人任务和复杂环境。

详情

展开后加载摘要…

URL PDF HTML 收藏