arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-11-14 至 2025-11-14 共收录 5 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 4 篇

2511.09958 2025-11-14 cs.RO cs.SD 92%

Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation

Xiangyi Wei, Haotian Zhang, Xinyi Cao, Siyu Xie, Weifeng Ge, Yang Li, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) School of Data Science and Engineering, East China Normal University(东华师范大学数据科学与工程学院) School of Software Engineering, East China Normal University(东华师范大学软件工程学院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title,abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12211 2025-11-14 cs.RO cs.AI 86%

Improving Pre-Trained Vision-Language-Action Policies with Model-Based Search

Cyrus Neary, Omar G. Younis, Artur Kuramshin, Ozgur Aslan, Glen Berseth

机构 * Mila — Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);language-conditioned robot(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05294 2025-11-14 cs.RO cs.AI cs.LG 75%

Towards Embodied Agentic AI: Review and Classification of LLM- and VLM-Driven Robot Autonomy and Interaction

Sahar Salimpour, Lei Fu, Kajetan Rachwał, Pascal Bertrand, Kevin O'Sullivan, Robert Jakob, Farhad Keramat, Leonardo Militano, Giovanni Toffetti, Harry Edelman, Jorge Peña Queralta

机构 * Department of Computing, University of Turku(图尔库大学计算机系) Institute of Computer Science, Zurich University of Applied Sciences(应用科学大学计算机科学研究所) Centre for Artificial Ingelligence, Zurich University of Applied Sciences(应用科学大学人工智能中心) Agentic Systems Lab, Department of Management, Technology and Economics, ETH Zürich(苏黎世联邦理工学院管理、科技与经济系代理系统实验室) Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10518 2025-11-14 cs.CV cs.RO 73%

SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation

Wei Li, Renshan Zhang, Rui Shao, Zhijian Fang, Kaiwen Zhou, Zhuotao Tian, Liqiang Nie

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

Comments Accepted to AAAI 2026 (Oral), Project Page: https://github.com/JiuTian-VL/SemanticVLA

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2511.10203 2025-11-14 cs.CV cs.AI cs.RO 67%

VISTA: A Vision and Intent-Aware Social Attention Framework for Multi-Agent Trajectory Prediction

Stephane Da Silva Martins, Emanuel Aldea, Sylvie Le Hégarat-Mascle

机构 * SATIE - CNRS UMR 8029 Paris-Saclay University, France(巴黎-萨克雷大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Paper accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏