arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-17 至 2026-08-17 共收录 6 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 5 篇

2608.13924 2026-08-17 cs.RO 新提交 92%

BICPO-VLA: Behavior-Identified Continuation Preference Optimization for Smooth Asynchronous Vision-Language-Action Control

BICPO-VLA:用于平滑异步视觉-语言-动作控制的行为识别延续偏好优化

Ming Shang, Yuchen Huang, Jiaoyang Chen, Haoyuan Hu, Han Yu, Liping Song, Luyun Feng, Shuo Bao, Wei Dong, Xinzhou Wang, Fuchun Sun

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title);分类 cs.RO

AI总结 BICPO-VLA针对异步视觉-语言-动作控制的请求交接间隙问题,通过行为识别、动作分解重建、参考相对Flow-DPO优化,实现平滑控制。

Comments 9 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14379 2026-08-17 cs.RO cs.AI 新提交 91%

Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation

Reflex:面向反应关键型操作的快速且可预测的视觉-语言-动作模型

Yuxuan Chen, Wanruo Zhang, Xiao Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 针对现有VLA模型忽略动态交互场景的问题,提出面向反应关键型操作的ReflexBench基准与无需大规模机器人数据预训练的ReflexVLA模型,其可提升动态操作性能并保持静态操作精度。

Comments 8 pages, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14047 2026-08-17 cs.RO cs.AI cs.CV 新提交 91%

Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use

将视觉-语言-动作模型进化为具备即时工具使用能力的智能体

Yi Ding, Yanzhao Yu, Xili Dai, Xianbiao Qi, Peiwen Sun, Xueqian Wang, Xiangyu Yue, Jianan Wang

机构 * Astribot(星舟机器人) Tsinghua University(清华大学) Juxi Tech(矩芯科技) IntelliFusion Inc.(智融公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究提出带工具使用的智能体机器人(ART)框架,调优VLA模型以利用工具模块,在模拟及真实任务中成功率较基线高20%,为VLA系统实际部署奠定基础。

Comments 12 pages, 4 figures, Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern (CVPR) Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern (CVPR) Findings, 2026, pp. 1346-1357

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14024 2026-08-17 cs.CV 新提交 91%

SSP: An Event-Matched Syn2Sim2Phy Cross-Domain Evaluation Framework for Autonomous Driving VLA Models

SSP:面向自动驾驶VLA模型的事件匹配Syn2Sim2Phy跨域评估框架

Haojie Feng, Peizhi Zhang, Xinrui Zhang, Zhuoren Li, Junpeng Huang, Xiurong Wang, Dongxiao Yin, Yuxiang Zhang, Junfan Zhu, Lu Xiong

机构 * College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) Tongji Automotive Design & Research Institute Co., Ltd.(同济汽车设计研究院有限公司) Hubei Jingchu Humanoid Robot Co., Ltd.(湖北荆楚人形机器人有限公司) University of Chicago(芝加哥大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.CV

AI总结 本文提出SSP框架,通过锚定同一安全关键交互事件实现自动驾驶VLA模型的跨域评估,在合成、仿真、真实域中测得不同模型的性能差异,为VLA行为提供可复现的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13688 2026-08-17 cond-mat.mtrl-sci physics.app-ph 新提交 50%

Thickness-dependent secondary-electron emission from suspended MoS$_2$ membranes in the helium ion microscope

氦离子显微镜中悬浮MoS₂膜的厚度依赖二次电子发射

Cyan Kim, David Lister, Philip Jackle, Karen L. Kavanagh

专题命中 VLA模型 :action model(abstract)

AI总结 研究发现氦离子显微镜中悬浮MoS₂膜的二次电子发射强度随厚度变化,在40-55 nm达峰值,通过非对称SE逃逸模型复现结果,可用于快速筛选膜厚及测试离子-固体相互作用模型。

Comments 6 pages, 3 figures. Submitted to Applied Physics Letters. Supplementary material included as an ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 部署与泛化 1 篇

2608.14028 2026-08-17 cs.RO cs.AI 新提交 62%

AdvDex: Learning Dexterous Manipulation from Human Demonstrations via Joint-Aligned Actions and Adversarial Learning

AdvDex:通过关节对齐动作与对抗学习从人类演示中学习灵巧操作

Zhiyue Zhao, Jingyi Wu, Hairuo Liu, Mingyu Liu, Liyang Li, Hengdi Zhang, Tong He, Zhengxue Cheng

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Paxini Tech(帕西尼科技)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 AdvDex是一种统一视觉-语言-动作框架,通过OmniShare数据集、JAAS动作空间与领域对抗学习,实现从人类和机器人演示中学习灵巧操作,提升跨实体泛化与技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏