arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-02 至 2026-03-02 共收录 7 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 4 篇

2512.14031 2026-03-02 cs.RO cs.AI 88%

Sample-Efficient Robot Skill Learning for Construction Tasks: Benchmarking Hierarchical Reinforcement Learning and Vision-Language-Action VLA Model

高效机器人技能学习用于建筑任务:评估分层强化学习与视觉-语言-动作VLA模型

Zhaofeng Hu, Hongrui Yu, Vaidhyanathan Chandramouli, Ci-Jyun Liang

机构 * Department of Civil Engineering, Stony Brook University(土木工程系,石溪大学) Department of Civil and Environmental Engineering, Virginia Tech(土木与环境工程系,弗吉尼亚理工大学) Department of Electrical and Computer Engineering, Virginia Tech(电气与计算机工程系,弗吉尼亚理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究比较了VLA模型和RL方法在建筑机器人技能学习中的效率与效果,发现VLA在泛化和少样本学习方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21157 2026-03-02 cs.RO 88%

HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning

HALO:一种用于具身多模态推理的统一视觉-语言-动作模型

Quanxin Shou, Fangqi Zhu, Shawn Chen, Puxin Yan, Zhengyang Yan, Yikun Miao, Xiaoyi Pang, Zicong Hong, Ruikai Shi, Hao Huang, Jie Zhang, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 HALO提出了一种统一的视觉-语言-动作模型,通过结合文本推理、视觉子目标预测和增强的动作预测,实现具身多模态链式推理,提升了机器人在复杂环境中的表现和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23648 2026-03-02 cs.RO 83%

FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation

FAVLA:一种力适应的快速-慢速VLA模型用于接触丰富的机械臂操作

Yao Li, Peiyuan Tang, Wuyang Zhang, Chengyang Zhu, Yifan Duan, Weikai Shi, Xiaodong Zhang, Zijiang Yang, Jianmin Ji, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Xi'an Jiaotong University(西安交通大学) Central South University(中南大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 FAVLA通过解耦慢感知规划与快速接触感知控制,提升接触丰富任务中的反应性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23583 2026-03-02 cs.RO 70%

VCA: Vision-Click-Action Framework for Precise Manipulation of Segmented Objects in Target Ambiguous Environments

VCA:面向目标模糊环境中的分割物体精确操控的视觉-点击-动作框架

Donggeon Kim, Seungwon Jan, Hyeonjun Park, Daegyu Lim

机构 * ROBROS Inc.(ROBROS公司)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 VCA框架通过视觉点击交互替代文本指令,实现目标模糊环境中分割物体的精确操控,提升机器人操作的准确性和实用性。

Comments Submitted to UR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 数据集与评测 2 篇

2512.24653 2026-03-02 cs.RO 70%

RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence

RoboMIND 2.0:一种多模态、双臂移动操作数据集,用于通用具身智能

Chengkai Hou, Kun Wu, Jiaming Liu, Zhengping Che, Di Wu, Fei Liao, Guangrun Li, Jingyang He, Qiuxuan Feng, Zhao Jin, Chenyang Gu, Zhuoyang Liu, Nuowei Han, Xiangju Mi, Yaoxu Lv, Yankai Fu, Gaole Dai, Langzhe Gu, Tao Li, Yuheng Zhang, Yixue Zhang, Xinhua Wang, Shichao Fan, Meng Li, Zhen Zhao, Ning Liu, Zhiyuan Xu, Pei Ren, Junjie Ji, Haonan Liu, Kuan Cheng, Shanghang Zhang, Jian Tang

专题命中 数据集与评测 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 RoboMIND 2.0通过多模态双臂移动操作数据集和MIND-2系统,提升通用具身智能的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23607 2026-03-02 cs.RO cs.SY eess.SY 57%

MicroPush: A Simulator and Benchmark for Contact-Rich Cell Pushing and Assembly with a Magnetic Rolling Microrobot

MicroPush:一种用于接触密集细胞推动和组装的模拟器和基准测试平台,配备磁性滚动微机器人

Yanda Yang, Sambeeta Das

机构 * Department of Mechanical Engineering, University of Delaware(机械工程系,德雷克塞尔大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.RO

AI总结 MicroPush提供了一个开源的模拟器和基准测试平台,用于评估磁性滚动微机器人在接触密集任务中的自主操作能力,包括细胞推动和多目标组装。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 1 篇

2602.24143 2026-03-02 cs.RO 57%

Robust Skills, Brittle Grounding: Diagnosing Restricted Generalization in Vision-Language Action Policies via Multi-Object Picking

稳健的技能,脆弱的接地:通过多对象拾取诊断视觉语言动作策略中的受限泛化

David Emukpere, Romain Deffayet, Jean-Michel Renders

机构 * Naver Labs Europe(纳维尔实验室欧洲)

专题命中 部署与泛化 :VLA(abstract);分类 cs.RO

AI总结 通过多对象拾取实验发现,视觉语言动作策略在复杂环境下执行基本操作比遵循指令更可靠,表明技能获取与指令遵循脱节,需改进基准测试以更准确诊断泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏