arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-11-25 至 2025-11-25 共收录 8 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2507.00416 2025-11-25 cs.RO cs.CV 88%

Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

Evo-0:具有隐式空间理解的视觉-语言-动作模型

Tao Lin, Gen Li, Yilei Zhong, Yanwen Zou, Yuxin Du, Jiting Liu, Encheng Gu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) University of Cambridge(剑桥大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17889 2025-11-25 cs.RO cs.CV 86%

MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots

MobileVLA-R1: 为移动机器人强化视觉-语言-动作

Ting Huang, Dongjian Li, Rui Yang, Zeyu Zhang, Zida Yang, Hao Tang

机构 * Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(title,abstract);vision language action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 MobileVLA-R1通过结合监督CoT对齐与GRPO强化学习,提升四足机器人在复杂环境中的视觉-语言-动作控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18950 2025-11-25 cs.RO cs.CV cs.LG 85%

Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation

Compressor-VLA:基于指令的视觉标记压缩用于高效的机器人操作

Juntao Gao, Feiyang Ye, Jing Zhang, Wenjing Qian

机构 * School of Information Science and Technology, Beijing University of Technology(信息科学与技术学院,北京理工大学) LiAuto Inc.(LiAuto公司) Beijing Key Laboratory of Computational Intelligence and Intelligent System, Beijing University of Technology(计算智能与智能系统北京市重点实验室,北京理工大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 Compressor-VLA通过指令引导的视觉标记压缩,提升机器人操作的效率与精度。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21354 2025-11-25 cs.CV cs.AI 84%

KV-Efficient VLA: A Method to Speed up Vision Language Models with RNN-Gated Chunked KV Cache

KV-Efficient VLA: 一种加速视觉语言模型的方法通过RNN门控分块KV缓存

Wanshun Xu, Long Zhuang, Lianlei Shan

机构 * University of Toronto(多伦多大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 KV-Efficient VLA通过RNN门控分块KV缓存机制,有效降低视觉语言模型的计算和内存开销,提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19236 2025-11-25 cs.RO cs.AI 81%

SENTINEL: A Fully End-to-End Language-Action Model for Humanoid Whole Body Control

SENTINEL:一种用于人形机器人全身控制的端到端语言-动作模型

Yuxuan Wang, Haobin Jiang, Shiqing Yao, Ziluo Ding, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 SENTINEL是一种端到端语言-动作模型,通过直接映射语言指令和本体感觉输入到低层动作,实现人形机器人全身控制,并支持多模态扩展。

Comments 23 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19082 2025-11-25 cond-mat.stat-mech 71%

Phase Diagrams of the YK Surface-Reaction Model on 2D lattices with Exchange Diffusion

二维晶格上具有交换扩散的YK表面反应模型的相图

Henrique A. Fernandes, Roberto da Silva, Paulo F. Gomes

专题命中 VLA模型 :action model(title)

AI总结 本研究通过稳态蒙特卡洛模拟,探讨了二维晶格上YK表面反应模型在不同解离率和交换扩散率下的相图特性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17443 2025-11-25 cs.HC cs.AI cs.GR 57%

GRAPHIC--Guidelines for Reviewing Algorithmic Practices in Human-centred Design and Interaction for Creativity

GRAPHIC--指导人本设计与交互中算法实践的审查指南

Joana Rovira Martins, Pedro Martins, Ana Boavida

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 GRAPHIC框架旨在分析应用于图形设计的计算系统,通过三大维度揭示人机协作中的研究空白,促进基于核心设计原则的创新。

Comments 20 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17642 2025-11-25 math.AP 50%

Cahn-Hilliard Equations on Lattices: Dynamic Transitions and Pattern Formations

晶格上的Cahn-Hilliard方程:动态相变与模式形成

Jared Grossman, Evan Halloran, Shouhong Wang

专题命中 VLA模型 :action model(abstract)

AI总结 本文研究了晶格上Cahn-Hilliard方程的动态相变与模式形成,探讨了基向量选择对相变和模式的影响,并分析了临界特征值的多重性及几何依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏