arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-02 至 2026-03-02 共收录 4 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 4 篇

2512.14031 2026-03-02 cs.RO cs.AI 88%

Sample-Efficient Robot Skill Learning for Construction Tasks: Benchmarking Hierarchical Reinforcement Learning and Vision-Language-Action VLA Model

高效机器人技能学习用于建筑任务:评估分层强化学习与视觉-语言-动作VLA模型

Zhaofeng Hu, Hongrui Yu, Vaidhyanathan Chandramouli, Ci-Jyun Liang

机构 * Department of Civil Engineering, Stony Brook University(土木工程系,石溪大学) Department of Civil and Environmental Engineering, Virginia Tech(土木与环境工程系,弗吉尼亚理工大学) Department of Electrical and Computer Engineering, Virginia Tech(电气与计算机工程系,弗吉尼亚理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究比较了VLA模型和RL方法在建筑机器人技能学习中的效率与效果,发现VLA在泛化和少样本学习方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21157 2026-03-02 cs.RO 88%

HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning

HALO:一种用于具身多模态推理的统一视觉-语言-动作模型

Quanxin Shou, Fangqi Zhu, Shawn Chen, Puxin Yan, Zhengyang Yan, Yikun Miao, Xiaoyi Pang, Zicong Hong, Ruikai Shi, Hao Huang, Jie Zhang, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 HALO提出了一种统一的视觉-语言-动作模型,通过结合文本推理、视觉子目标预测和增强的动作预测,实现具身多模态链式推理,提升了机器人在复杂环境中的表现和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23648 2026-03-02 cs.RO 83%

FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation

FAVLA:一种力适应的快速-慢速VLA模型用于接触丰富的机械臂操作

Yao Li, Peiyuan Tang, Wuyang Zhang, Chengyang Zhu, Yifan Duan, Weikai Shi, Xiaodong Zhang, Zijiang Yang, Jianmin Ji, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Xi'an Jiaotong University(西安交通大学) Central South University(中南大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 FAVLA通过解耦慢感知规划与快速接触感知控制,提升接触丰富任务中的反应性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23583 2026-03-02 cs.RO 70%

VCA: Vision-Click-Action Framework for Precise Manipulation of Segmented Objects in Target Ambiguous Environments

VCA:面向目标模糊环境中的分割物体精确操控的视觉-点击-动作框架

Donggeon Kim, Seungwon Jan, Hyeonjun Park, Daegyu Lim

机构 * ROBROS Inc.(ROBROS公司)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 VCA框架通过视觉点击交互替代文本指令,实现目标模糊环境中分割物体的精确操控,提升机器人操作的准确性和实用性。

Comments Submitted to UR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏