arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-12-24 至 2025-12-24 共收录 9 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 8 篇

2512.20188 2025-12-24 cs.RO cs.AI 84%

Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation

异步快速-慢速视觉-语言-动作策略用于全身机器人操作

Teqiang Zou, Hongliang Zeng, Yuxuan Nong, Yifan Li, Kehui Liu, Haotian Yang, Xinyang Ling, Xin Li, Lianyang Ma

机构 * AstriBot Team(AstriBot团队)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 DuoCore-FS通过异步快速-慢速框架提升全身机器人操作的实时性能与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14396 2025-12-24 cs.RO cs.AI cs.CV 82%

Continuous Vision-Language-Action Co-Learning with Semantic-Physical Alignment for Behavioral Cloning

具有语义-物理对齐的连续视觉-语言-动作共学用于行为克隆

Xiuxiu Qi, Yu Yang, Jiannong Cao, Luyao Bai, Chongshan Fan, Chengtai Cao, Hongpeng Wang

专题命中 VLA模型 :vision-language-action(title,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出CCoL框架,通过连续共学视觉、语言和动作,解决行为克隆中的语义-物理不一致问题,提升动作执行的准确性和鲁棒性。

Comments Accepted at AAAI 2026, the Project website is available at https://qhemu.github.io/CCoL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20276 2025-12-24 cs.AI cs.RO 73%

ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge

ActionFlow:面向边缘设备的视觉语言模型流水线动作加速

Yuntao Dai, Hang Gu, Teng Wang, Qianyu Cheng, Yifei Zheng, Zhiyong Qiu, Lei Gong, Wenqi Lou, Xuehai Zhou

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(苏州市先进研究院,中国科学技术大学) IEIT SYSTEMS Co., Ltd.(IEIT SYSTEMS公司)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 ActionFlow通过跨请求流水线策略提升边缘设备上VLA模型的推理速度,实现2.55倍的FPS提升,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20166 2025-12-24 cs.RO 70%

LoLA: Long Horizon Latent Action Learning for General Robot Manipulation

LoLA:面向通用机器人操作的长周期隐式动作学习

Xiaofan Wang, Xingyu Gao, Jianlong Fu, Zuolei Li, Dean Fortier, Galen Mullins, Andrey Kolobov, Baining Guo

机构 * Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学) Microsoft Research(微软研究院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 LoLA通过整合长期多视角观察和机器人本体感觉,实现长周期、语言引导的机器人操作任务,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08189 2025-12-24 cs.CV 70%

Reinforcement Learning for Large Model: A Survey

为大模型设计强化学习:综述

Weijia Wu, Chen Gao, Joya Chen, Kevin Qinghong Lin, Qingwei Meng, Yiming Zhang, Yuke Qiu, Hong Zhou, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 本文综述了视觉强化学习领域,探讨了多模态大语言模型、视觉生成等四个主题,分析了算法设计、奖励工程及评估协议,并指出了样本效率、泛化能力等开放挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20052 2025-12-24 cs.AI cs.RO 62%

Learning Skills from Action-Free Videos

从无动作视频中学习技能

Hung-Chieh Fang, Kuo-Han Hung, Chu-Rong Chen, Po-Jung Chou, Chun-Kai Yang, Po-Chen Ko, Yu-Chiang Wang, Yueh-Hua Wu, Min-Hung Chen, Shao-Hua Sun

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出SOF框架,通过从无动作视频中学习潜在技能,实现视频动态与机器人动作的对齐,提升多任务和长周期任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20252 2025-12-24 physics.comp-ph cs.NA math.NA 50%

An immersed boundary method for the discrete velocity model of the Boltzmann equation

用于玻尔兹曼方程离散速度模型的浸入边界方法

Longqing Ge, Qingdong Cai, Yonghao Zhang, Tianbai Xiao

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出了一种用于玻尔兹曼方程离散速度模型的浸入边界方法,通过改进的插值策略和切分元修正方法,实现了高精度的流体-结构相互作用模拟。

Comments 44 pages, 25 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19792 2025-12-24 astro-ph.CO astro-ph.GA 50%

A multiwavelength study of an early galaxy group merger in COSMOS revealed by two tailed radio galaxies at z = 0.35

利用多波段观测研究一个早期星系团合并的COSMOS场,通过z=0.35处的双尾射电星系揭示

Paula Vulić, Vernesa Smolčić, Ghassem Gozaliasl, Ivan Delvecchio, Alexis Finoguenov

专题命中 VLA模型 :VLA(abstract)

AI总结 利用多波段观测发现z=0.35处的双尾射电星系,揭示早期星系团合并的动态年轻特性。

Journal ref A&A, 704, A337 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 部署与泛化 1 篇

2512.01801 2025-12-24 cs.RO cs.LG 79%

GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation

GR-RL:为长周期机械操作实现灵活与精确

Yunfei Li, Xiao Ma, Jiafeng Xu, Yu Cui, Zhongren Cui, Zhigang Han, Liqun Huang, Tao Kong, Yuxiao Liu, Hao Niu, Wanli Peng, Jingchao Qiao, Zeyu Ren, Haixin Shi, Zhi Su, Jiawen Tian, Yuyang Xiao, Shenyu Zhang, Liwei Zheng, Hang Li, Yonghui Wu

机构 * ByteDance(字节跳动)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);robot foundation model(abstract);分类 cs.RO、cs.LG

AI总结 GR-RL通过多阶段训练管道,将通用VLA策略转化为擅长长周期精确操作的专家策略,成功实现自主系鞋带任务。

详情

展开后加载摘要…

URL PDF HTML 收藏