arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-12-02 至 2025-12-02 共收录 1 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 部署与泛化 1 篇

2512.00797 2025-12-02 cs.RO 57%

Transforming Monolithic Foundation Models into Embodied Multi-Agent Architectures for Human-Robot Collaboration

将单体基础模型转化为具身体验的多智能体架构以实现人机协作

Nan Sun, Bo Mao, Yongchang Li, Chenxu Wang, Di Guo, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO

AI总结 InteractGen通过分解机器人智能为多个智能体,提升服务机器人在人类环境中的自主性和协作能力。

Comments 21 pages, 16 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏