arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-27 至 2026-08-27 共收录 15 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 14 篇

2608.25864 2026-08-27 cs.RO 新提交 94%

MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization

MA-VLA:用于协作与组合泛化的多臂视觉-语言-动作模型

Zaibin Zhang, Junlan Xiao, Zhongbo Zhang, Yifan Wang, Li Kang, Yiran Qin, Changxing Xia, Heng Zhou, Talas Fu, Enshen Zhou, Ruimao Zhang, Zhenfei Yin, Huchuan Lu, Lijun Wang

机构 * Dalian University of Technology(大连理工大学) University of Oxford(牛津大学) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beihang University(北京航空航天大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 MA-VLA通过将协作行为分解为原子提示并引入Arm Shuffle训练方法,解决了多臂VLA模型的协作泛化问题,在未见过的协作模式下表现优于现有模型。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24959 2026-08-27 cs.RO cs.CV 新提交 91%

GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model

GaussVLA:面向视觉-语言-动作模型的几何感知空间推理

Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn

机构 * Yeungnam University(岭南大学) Kyungpook National University(庆北国立大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 提出基于Mamba的VLA模型GaussVLA,通过高斯空间分词器和深度感知思维链提升空间推理能力,在LIBERO数据集上仅2亿参数就实现93.5%平均成功率,优于SpatialVLA且参数效率更高。

Comments Accepted to BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26067 2026-08-27 cs.CV 新提交 91%

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

StreamPI:面向视觉-语言-动作模型的流式多模态时序建模

Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ACE Robotics(ACE机器人公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV

AI总结 本文提出StreamPI框架,为单帧VLA模型赋予时序推理能力,通过指令锚定时序建模、随机间隔流式训练等方法,在真实机器人与仿真基准任务上性能优于pi0.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25308 2026-08-27 cs.CV 新提交 91%

V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models

V-Link:为视觉-语言-动作模型恢复动作DiT中丢失的视觉表征

Yehao Lu, Jiarui Yang, Yuning Su, Yufeng Xie, Yu Zhong, Yazhou Zhang, Haiyu Lan, Kaixiang Lu, Peiwen Lin, Chuang Wang, Zequn Qin, Enyu Li, Xi Li

机构 * Zhejiang University(浙江大学) AGIBOT The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Simon Fraser University(西蒙菲莎大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV

AI总结 本研究针对VLA模型中动作专家访问视觉信息不足的问题,提出V-Link方法,通过注入空间与语义查询提升动作DiT性能,在多个机器人操作基准及现实任务中均取得显著成功率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25585 2026-08-27 cs.RO 新提交 91%

RA-VLA: Retrieval-Augmented VLA for Test-Time Adaptation

RA-VLA:用于测试时自适应的检索增强视觉-语言-动作模型

Sanghwan Jang, Minjin Jeon, Minsoo Kim, Seongjin Choi, Dongha Kim, Hwanjo Yu

机构 * POSTECH(浦项科技大学) Department of Computer Science and Engineering, POSTECH(浦项科技大学计算机科学与工程学院) Graduate School of Artificial Intelligence, POSTECH(浦项科技大学人工智能研究生院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 该研究针对VLA模型面对新任务分布时的脆弱性问题,提出RA-VLA检索增强VLA框架,在LIBERO基准和UR5e环境中验证其可提升机器人操纵的任务适应成功率与计算效率。

Comments ICML 2026. Contact: this http URL (http://s.jang) @postech. this http URL (http://ac.kr)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25757 2026-08-27 cs.RO cs.LG 新提交 84%

LM-X: Explainable Action Modeling with Progress, Event, and Uncertainty Prediction for Generalist Robot Manipulation

LM-X:面向通用机器人操控的、具备进度、事件与不确定性预测能力的可解释动作建模方法

Jin Lou, Jingxuan Zhu, Andong Chen, Xupeng Wang, Yuan Xu, Yuexuan Li, Xingdong Zhu, Zhijie Zhu, Yingwei Ji, Wenpeng Nie, Jingyi Li, Liangliang Chen, Jinyan Liu, Zhiqi Song, Jidong Zhang, Hongming Li, Yuchen Zhu

机构 * Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司) E-surfing Digital Life Technology Co., Ltd., China Telecom(中国电信天翼数字生活科技有限公司)

专题命中 VLA模型 :action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 LM-X是一种面向通用机器人操控的可解释动作建模方法,通过多尺度预测信号提升操控成功率,在RoboTwin2.0等任务上显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25400 2026-08-27 astro-ph.SR 新提交 80%

Broadband 12-26 GHz Radio Radiation Reveals Evidence for Micro-flares on AU Mic

12-26 GHz宽带射电辐射揭示AU微星上存在微耀斑的证据

Isaiah I. Tristan, Rachel A. Osten, Yuta Notsu, Adina D. Feinstein, Adam F. Kowalski

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 研究通过VLA对AU微星的12-26 GHz射电观测,发现其存在微耀斑,揭示活跃M型矮星日冕非热射电辐射由连续微耀斑和磁场捕获主导。

Comments 11 pages, 4 figures, 4 tables. Accepted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25956 2026-08-27 cs.CV 新提交 79%

4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting

4DGS-WAM:基于4D高斯溅射的以对象为中心的世界动作模型,连接过去与未来

Yueen Ma, Zenglin Xu, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 本研究提出基于4D高斯溅射的以对象为中心的世界动作模型4DGS-WAM,将2D观测转为持久4D表示,复用静态内容以聚焦动态对象演化,在KITTI-MOT上完成短程预测与过去重建评估。

Comments This is a work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26058 2026-08-27 cs.RO 新提交 77%

One Policy, Many Embodiments: Unified Camera-Centric Action Geometry Pre-training for Heterogeneous Embodied Manipulation

单一策略,多种具现体:面向异构具身操纵的以相机为中心的统一动作几何预训练

Xiaomi Embodied Intelligence Team, University of Macau: Shaoqing Xu, Fang Li, Guozhi Zhan, Zhixiang Duan, Yuhan Wang, Yuechen Luo, Shengyin Jiang, Hanbing Li, Zhiying Du, Longlong Wang, Longmei Jiang, Weixiang Liang, Ying Gong, Yong Pan, Ziping Zhao, Zhiyuan Chen, Yangwei You, Kun Ma, Qinyuan Liu, Hangjun Ye, Zhi-xin Yang

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队) University of Macau(澳门大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 该研究针对异构具身操纵数据的问题,提出UCAG-P预训练方法,通过以相机为中心的统一动作公式对齐数据,在多个基准任务上取得优异性能,无需特定微调。

Comments Technical Report,Project page: this https URL (https://public-bots.github.io/UCAG-P)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25659 2026-08-27 cs.RO 新提交 77%

GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation

Yuqing Jiang, Zijian Zhang, Weitao Zhou, Jiawei Wang, Junjie He, Lei Yang, Haifang Qing, Si Liu, Ding Zhao, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);language-conditioned robot(abstract);分类 cs.RO

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25798 2026-08-27 cs.RO cs.LG 新提交 73%

TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

TacForcing:结合执行时触觉反馈的流式动作生成

Jianbo Zhou, Boyuan Zhao, Yuzheng Zhang, Yiyang Chen, Wenxin Chen, Qiuyue Li, Xiangyang Gu, Yuhan Cao, Xiao Xia, Yanzhe Hu, Zhijie Deng

机构 * School of Computer Science, SJTU(上海交通大学计算机科学学院) SCUT(华南理工大学) ECUST(华东理工大学) ECNU(华东师范大学) PolyU(香港理工大学) CCUT(长春工业大学) UESTC(电子科技大学) HUST(华中科技大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出TacForcing框架,通过流式动作专家结合执行时触觉反馈,并引入EATA减少时间不匹配,在模拟和真实接触操纵任务中均优于基线方法。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24922 2026-08-27 physics.chem-ph cond-mat.mtrl-sci 新提交 71%

Multi-Species Multi-Reaction Model Parametrization of a Commercial NCA Positive Electrode from Half-Cell Open-Circuit Potential Data

基于半电池开路电位数据的商用NCA正极的多物种多反应模型参数化

Michele Galasso, Petr Čech, Ivo Horstkötter, Simon Schwunk, Zuzana Vlčková Živcová, Václav Knap

专题命中 VLA模型 :action model(title)

AI总结 本研究通过半电池开路电位数据对商用NCA正极进行多物种多反应(MSMR)模型参数化,发现NCA正极热力学特征在老化中基本不变,支持固定电极固有参数、将老化归因于电极层面变化的建模方法。

Comments 21 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25395 2026-08-27 cs.RO 新提交 70%

A Taxonomy of Construction Task Activities for Robot Workers

机器人工人的施工任务活动分类学

Sadman Sakib, Zhangyi None Peng, Yujie Pang, Yu Otsuki, Mohammad Abdullah Al Faruque

机构 * University of California-Irvine(加利福尼亚大学欧文分校) UCInspire

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 该研究提出基于职业的TARCAT分类学,定义施工任务的动作基元,在机械臂上演示相关基元,为通用施工机器人开发提供通用词汇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25281 2026-08-27 math.OC eess.SY math-ph stat.ML 新提交 50%

Schrödinger Bridges over Kinetic Swarming Models

基于动力学蜂拥模型的薛定谔桥

Asmaa Eldesoukey, Md Zulfiqur Haider, Italo Napolitano, Yongxin Chen, Abhishek Halder

专题命中 VLA模型 :action model(abstract)

AI总结 该研究针对受随机扰动的惯性蜂拥,基于薛定谔桥理论,提出嵌套不动点方案求解最优控制,实现有限时间内将蜂拥群体引导至规定端点分布的目标。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 部署与泛化 1 篇

2608.26103 2026-08-27 cs.RO cs.CV 新提交 81%

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

Zero-WAM:基于人类视频的上下文世界-动作建模用于开放式任务泛化

Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu

专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 Zero-WAM是基于人类视频的因果视频-动作模型,通过提出自动流水线构建HumanGen数据集、引入IFP目标,在RoboTwin 2.0仿真7个未见任务上平均成功率达47.0%,实现机器人操作零样本跨任务泛化。

Comments this https URL (https://robbyant-research.github.io/Zero-WAM/)

详情

展开后加载摘要…

URL PDF HTML 收藏