arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-08-21 至 2025-08-21 共收录 3 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 3 篇

2505.15206 2025-08-21 cs.RO cs.AI 88%

EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy

Chi Kit Ng, Long Bai, Guankun Wang, Yupeng Wang, Huxin Gao, Kun Yuan, Chenhan Jin, Tieyong Zeng, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Technical University of Munich(慕尼黑技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06484 2025-08-21 cs.GR cs.CV 84%

3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds

Fan-Yun Sun, Shengguang Wu, Christian Jacobsen, Thomas Yim, Haoming Zou, Alex Zook, Shangru Li, Yu-Hsin Chou, Ethem Can, Xunlei Wu, Clemens Eppner, Valts Blukis, Jonathan Tremblay, Jiajun Wu, Stan Birchfield, Nick Haber

机构 * Stanford University(斯坦福大学) Nvidia Research(英伟达研究)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.CV

Comments project website: https://ai.stanford.edu/~sunfanyun/3d-generalist/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14792 2025-08-21 hep-ph 50%

Solar wind bremsstrahlung in our Solar System at 21cm, 3mm, and 12microns Wavelengths

Gilles Couture

专题命中 VLA模型 :VLA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏