arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-11-24 至 2025-11-24 共收录 3 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2511.17199 2025-11-24 cs.CV 91%

VLA-4D: Embedding 4D Awareness into Vision-Language-Action Models for SpatioTemporally Coherent Robotic Manipulation

VLA-4D: 将4D意识嵌入视觉-语言-动作模型中以实现时空一致的机器人操作

Hanyu Zhou, Chuanhao Ma, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.CV

AI总结 VLA-4D通过4D意识增强视觉-语言-动作模型,实现时空一致的机器人操作,提升动作执行的空间平滑性和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17366 2025-11-24 cs.RO cs.CV 88%

METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model

METIS:多源自体训练用于集成的灵巧视觉-语言-动作模型

Yankai Fu, Ning Chen, Junkai Zhao, Shaozhe Shan, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 METIS通过多源自体训练构建集成的视觉-语言-动作模型,提升灵巧操作的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23463 2025-11-24 cs.CV 88%

OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model

OpenDriveVLA: 向端到端自动驾驶迈进的大型视觉语言动作模型

Xingcheng Zhou, Xuyuan Han, Feng Yang, Yunpu Ma, Volker Tresp, Alois Knoll

机构 * Technical University of Munich(慕尼黑技术大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 VLA模型 :vision language action(title,abstract);action model(title,abstract);分类 cs.CV

AI总结 OpenDriveVLA基于开源大语言模型,通过多模态输入和分层视觉语言对齐,实现端到端自动驾驶中的高精度轨迹规划和驾驶任务回答。

详情

展开后加载摘要…

URL PDF HTML 收藏