arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-04 至 2026-02-04 共收录 6 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 6 篇

2602.03445 2026-02-04 cs.AI cs.LG cs.RO 89%

CRL-VLA: Continual Vision-Language-Action Learning

CRL-VLA:持续视觉-语言-动作学习

Qixin Zeng, Shuo Zhang, Hongyin Zhang, Renjie Wang, Han Zhao, Libang Zhao, Runze Li, Donglin Wang, Chao Huang

机构 * University of Southampton, UK(英国南安普顿大学) Westlake University, China(西湖大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 CRL-VLA通过双批评者架构和目标条件价值公式,实现VLA模型在持续学习中的稳定与可塑性平衡,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03782 2026-02-04 cs.CV cs.RO 88%

QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization

QVLA:视觉-语言-动作模型量化中并非所有通道都平等

Yuhao Xu, Yantai Yang, Zhenyang Fan, Yufan Liu, Yuming Li, Bing Li, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(自动化实验室,人工智能学院,上海交通大学) Anyverse Dynamics State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Terminal Technology Department, Alipay, Ant Group(终端技术部,蚂蚁集团)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 QVLA提出了一种动作导向的量化框架,通过按通道分配比特数来优化视觉-语言-动作模型的压缩,实现了更高的性能和效率。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21712 2026-02-04 cs.RO 88%

CoFreeVLA: Collision-Free Dual-Arm Manipulation via Vision-Language-Action Model and Risk Estimation

CoFreeVLA:通过视觉-语言-动作模型和风险估计实现碰撞-free双臂操作

Xuanran Zhai, Binkai Ou, Qiaojun Yu, Ce Hao, Yaohua Liu

专题命中 VLA模型 :vision-language-action(title);action model(title);vision language action(abstract);VLA(abstract)

AI总结 CoFreeVLA通过视觉-语言-动作模型和风险估计实现双臂操作的安全性提升,有效减少自我碰撞并提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21602 2026-02-04 cs.RO 88%

AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation

AIR-VLA:面向空中操作的视觉-语言-动作系统

Jianli Sun, Bin Tian, Qiyao Zhang, Chengxiang Li, Zihan Song, Zhiyong Cui, Yisheng Lv, Yonglin Tian

机构 * The Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Information and Intelligent Engineering, University of Sanya(三亚大学信息与智能工程学院) School of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与车辆工程学院) State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.RO

AI总结 AIR-VLA提出首个针对空中操作的视觉-语言-动作系统,通过构建仿真环境和多模态数据集,评估主流模型并揭示其在无人机移动、机械臂控制和高层规划中的能力和限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03153 2026-02-04 cs.RO 70%

When Attention Betrays: Erasing Backdoor Attacks in Robotic Policies by Reconstructing Visual Tokens

当注意力背叛时:通过重建视觉标记在机器人策略中消除后门攻击

Xuetao Li, Pinhan Fu, Wenke Huang, Nengyuan Pan, Songhua Yang, Kaiyan Zhao, Guancheng Wan, Mengde Li, Jifeng Xuan, Miao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Faculty of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Institute of Technological Sciences, Wuhan University(武汉大学技术科学研究院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 Bera通过重建视觉标记消除机器人策略中的后门攻击,无需重新训练模型即可有效防御后门风险。

Comments ICRA2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02864 2026-02-04 cs.RO 70%

Accelerating Structured Chain-of-Thought in Autonomous Vehicles

加速自动驾驶中的结构化链式推理

Yi Gu, Yan Wang, Yuxiao Chen, Yurong You, Wenjie Luo, Yue Wang, Wenhao Ding, Boyi Li, Heng Yang, Boris Ivanovic, Marco Pavone

机构 * NVIDIA University of Southern California(南加州大学) Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 FastDriveCoT通过并行解码方法加速自动驾驶中的结构化链式推理,实现3-4倍的生成速度提升和端到端延迟的显著降低,同时保持推理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏