arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-10-09 至 2025-10-09 共收录 8 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2510.07077 2025-10-09 cs.RO cs.AI cs.CV cs.LG 90%

Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications

Kento Kawaharazuka, Jihoon Oh, Jun Yamada, Ingmar Posner, Yuke Zhu

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学计算机科学系)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV、cs.AI

Comments Accepted to IEEE Access, website: https://vla-survey.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07134 2025-10-09 cs.RO cs.AI cs.CV 85%

TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking

Jiahang Liu, Yunpeng Qi, Jiazhao Zhang, Minghan Li, Shaoan Wang, Kui Wu, Hanjing Ye, Hong Zhang, Zhibo Chen, Fangwei Zhong, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot USTC(中国科学技术大学) BAAI(北京人工智能研究院) Beihang University(北京航空航天大学) SUSTech(四川大学) Beijing Normal University(北京师范大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Project page: https://pku-epic.github.io/TrackVLA-plus-plus-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07067 2025-10-09 cs.RO 83%

Bring the Apple, Not the Sofa: Impact of Irrelevant Context in Embodied AI Commands on VLA Models

Daria Pugacheva, Andrey Moskalenko, Denis Shepelev, Andrey Kuznetsov, Vlad Shakhuro, Elena Tutubalina

专题命中 VLA模型 :VLA(title,abstract);vision language action(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02152 2025-10-09 cs.RO 83%

Interleave-VLA: Enhancing Robot Manipulation with Interleaved Image-Text Instructions

Cunxin Fan, Xiaosong Jia, Yihang Sun, Yixiao Wang, Jianglan Wei, Ziyang Gong, Xiangyu Zhao, Masayoshi Tomizuka, Xue Yang, Junchi Yan, Mingyu Ding

机构 * Shanghai Jiao Tong University(上海交通大学) UC Berkeley(伯克利大学) UNC, Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06828 2025-10-09 cs.LG cs.AI 76%

Recurrence-Complete Frame-based Action Models

Michael Keiblinger

机构 * Prime Intellect

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07313 2025-10-09 cs.CV cs.RO 62%

WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation

Zezhong Qian, Xiaowei Chi, Yuming Li, Shizun Wang, Zhiyuan Qin, Xiaozhu Ju, Sirui Han, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国家大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06679 2025-10-09 cs.CV 57%

DreamOmni2: Multimodal Instruction-based Editing and Generation

Bin Xia, Bohao Peng, Yuechen Zhang, Junjia Huang, Jiyang Liu, Jingyao Li, Haoru Tan, Sitong Wu, Chengyao Wang, Yitong Wang, Xinglong Wu, Bei Yu, Jiaya Jia

机构 * CUHK(香港中文大学) HKUST(香港科技大学) HKU(香港大学) ByteDance Inc(字节跳动公司)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06504 2025-10-09 cs.CV 57%

Text2Interact: High-Fidelity and Diverse Text-to-Two-Person Interaction Generation

Qingxuan Wu, Zhiyang Dou, Chuan Guo, Yiming Huang, Qiao Feng, Bing Zhou, Jian Wang, Lingjie Liu

机构 * University of Pennsylvania(宾夕法尼亚大学) The University of Hong Kong(香港大学) Snap Inc(Snap公司)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏