arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-08-21 至 2025-08-21 共收录 4 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 3 篇

2505.15206 2025-08-21 cs.RO cs.AI 88%

EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy

Chi Kit Ng, Long Bai, Guankun Wang, Yupeng Wang, Huxin Gao, Kun Yuan, Chenhan Jin, Tieyong Zeng, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Technical University of Munich(慕尼黑技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06484 2025-08-21 cs.GR cs.CV 84%

3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds

Fan-Yun Sun, Shengguang Wu, Christian Jacobsen, Thomas Yim, Haoming Zou, Alex Zook, Shangru Li, Yu-Hsin Chou, Ethem Can, Xunlei Wu, Clemens Eppner, Valts Blukis, Jonathan Tremblay, Jiajun Wu, Stan Birchfield, Nick Haber

机构 * Stanford University(斯坦福大学) Nvidia Research(英伟达研究)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.CV

Comments project website: https://ai.stanford.edu/~sunfanyun/3d-generalist/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14792 2025-08-21 hep-ph 50%

Solar wind bremsstrahlung in our Solar System at 21cm, 3mm, and 12microns Wavelengths

Gilles Couture

专题命中 VLA模型 :VLA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2506.18897 2025-08-21 cs.RO cs.AI 73%

MinD: Learning A Dual-System World Model for Real-Time Planning and Implicit Risk Analysis

Xiaowei Chi, Kuangzhi Ge, Jiaming Liu, Siyuan Zhou, Peidong Jia, Zichen He, Yuzhen Liu, Tingguang Li, Lei Han, Sirui Han, Shanghang Zhang, Yike Guo

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏