arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-27 至 2026-08-27 共收录 23 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 20 篇

2608.25864 2026-08-27 cs.RO 新提交 94%

MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization

MA-VLA:用于协作与组合泛化的多臂视觉-语言-动作模型

Zaibin Zhang, Junlan Xiao, Zhongbo Zhang, Yifan Wang, Li Kang, Yiran Qin, Changxing Xia, Heng Zhou, Talas Fu, Enshen Zhou, Ruimao Zhang, Zhenfei Yin, Huchuan Lu, Lijun Wang

机构 * Dalian University of Technology(大连理工大学) University of Oxford(牛津大学) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beihang University(北京航空航天大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 MA-VLA通过将协作行为分解为原子提示并引入Arm Shuffle训练方法,解决了多臂VLA模型的协作泛化问题,在未见过的协作模式下表现优于现有模型。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24959 2026-08-27 cs.RO cs.CV 新提交 91%

GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model

GaussVLA:面向视觉-语言-动作模型的几何感知空间推理

Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn

机构 * Yeungnam University(岭南大学) Kyungpook National University(庆北国立大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 提出基于Mamba的VLA模型GaussVLA,通过高斯空间分词器和深度感知思维链提升空间推理能力,在LIBERO数据集上仅2亿参数就实现93.5%平均成功率,优于SpatialVLA且参数效率更高。

Comments Accepted to BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26067 2026-08-27 cs.CV 新提交 91%

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

StreamPI:面向视觉-语言-动作模型的流式多模态时序建模

Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ACE Robotics(ACE机器人公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV

AI总结 本文提出StreamPI框架,为单帧VLA模型赋予时序推理能力,通过指令锚定时序建模、随机间隔流式训练等方法,在真实机器人与仿真基准任务上性能优于pi0.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25308 2026-08-27 cs.CV 新提交 91%

V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models

V-Link:为视觉-语言-动作模型恢复动作DiT中丢失的视觉表征

Yehao Lu, Jiarui Yang, Yuning Su, Yufeng Xie, Yu Zhong, Yazhou Zhang, Haiyu Lan, Kaixiang Lu, Peiwen Lin, Chuang Wang, Zequn Qin, Enyu Li, Xi Li

机构 * Zhejiang University(浙江大学) AGIBOT The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Simon Fraser University(西蒙菲莎大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV

AI总结 本研究针对VLA模型中动作专家访问视觉信息不足的问题,提出V-Link方法,通过注入空间与语义查询提升动作DiT性能,在多个机器人操作基准及现实任务中均取得显著成功率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00686 2026-08-27 cs.RO 版本更新 91%

Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching

通过自适应视觉令牌缓存学习加速视觉-语言-动作模型

Yujie Wei, Jiahan Fan, Jiyu Guo, Ruichen Zhen, Rui Shao, Xiu Su, Zeke Xie, Hongxun Yao, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院) Central South University(中南大学) HKUST(GZ)(香港科技大学(广州))

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出通过自适应视觉令牌缓存学习加速VLA模型,提升推理效率并提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25585 2026-08-27 cs.RO 新提交 91%

RA-VLA: Retrieval-Augmented VLA for Test-Time Adaptation

RA-VLA:用于测试时自适应的检索增强视觉-语言-动作模型

Sanghwan Jang, Minjin Jeon, Minsoo Kim, Seongjin Choi, Dongha Kim, Hwanjo Yu

机构 * POSTECH(浦项科技大学) Department of Computer Science and Engineering, POSTECH(浦项科技大学计算机科学与工程学院) Graduate School of Artificial Intelligence, POSTECH(浦项科技大学人工智能研究生院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 该研究针对VLA模型面对新任务分布时的脆弱性问题,提出RA-VLA检索增强VLA框架,在LIBERO基准和UR5e环境中验证其可提升机器人操纵的任务适应成功率与计算效率。

Comments ICML 2026. Contact: this http URL (http://s.jang) @postech. this http URL (http://ac.kr)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22991 2026-08-27 cs.CV 版本更新 84%

Training-Free Interaction-Aligned Visual Token Pruning for Efficient Embodied Manipulation

VLA-IAP: 通过交互对齐实现无训练视觉令牌剪枝用于视觉-语言-动作模型

Jintao Cheng, Weibin Li, Haozhe Wang, Gang Wang, Yipu Zhang, Xiaoyu Tang, Jin Wu, Xieyuanli Chen, Yunhui Liu, Wei Zhang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) South China Normal University(华南师范大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) National University of Defense Technology(国防科技大学)

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.CV

AI总结 本文提出VLA-IAP方法,通过引入几何先验机制和动态调度策略,实现无训练的视觉令牌剪枝,提升VLA模型在资源受限平台上的推理效率和稳定性,实验显示在LIBERO基准上成功率达97.8%且速度提升1.25倍。

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25757 2026-08-27 cs.RO cs.LG 新提交 84%

LM-X: Explainable Action Modeling with Progress, Event, and Uncertainty Prediction for Generalist Robot Manipulation

LM-X:面向通用机器人操控的、具备进度、事件与不确定性预测能力的可解释动作建模方法

Jin Lou, Jingxuan Zhu, Andong Chen, Xupeng Wang, Yuan Xu, Yuexuan Li, Xingdong Zhu, Zhijie Zhu, Yingwei Ji, Wenpeng Nie, Jingyi Li, Liangliang Chen, Jinyan Liu, Zhiqi Song, Jidong Zhang, Hongming Li, Yuchen Zhu

机构 * Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司) E-surfing Digital Life Technology Co., Ltd., China Telecom(中国电信天翼数字生活科技有限公司)

专题命中 VLA模型 :action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 LM-X是一种面向通用机器人操控的可解释动作建模方法,通过多尺度预测信号提升操控成功率,在RoboTwin2.0等任务上显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25400 2026-08-27 astro-ph.SR 新提交 80%

Broadband 12-26 GHz Radio Radiation Reveals Evidence for Micro-flares on AU Mic

12-26 GHz宽带射电辐射揭示AU微星上存在微耀斑的证据

Isaiah I. Tristan, Rachel A. Osten, Yuta Notsu, Adina D. Feinstein, Adam F. Kowalski

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 研究通过VLA对AU微星的12-26 GHz射电观测,发现其存在微耀斑,揭示活跃M型矮星日冕非热射电辐射由连续微耀斑和磁场捕获主导。

Comments 11 pages, 4 figures, 4 tables. Accepted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25956 2026-08-27 cs.CV 新提交 79%

4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting

4DGS-WAM:基于4D高斯溅射的以对象为中心的世界动作模型,连接过去与未来

Yueen Ma, Zenglin Xu, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 本研究提出基于4D高斯溅射的以对象为中心的世界动作模型4DGS-WAM,将2D观测转为持久4D表示,复用静态内容以聚焦动态对象演化,在KITTI-MOT上完成短程预测与过去重建评估。

Comments This is a work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27947 2026-08-27 cs.RO 版本更新 79%

SANTS: A State-Adaptive Scheduler for World Action Models

SANTS:面向世界动作模型的状态自适应调度器

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Shiqin Dai, Xinyu Bing, Zhongxue Gan, Chunxu Tian

机构 * Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Deep Computing Era Technology Co., Ltd(深计算时代科技有限公司)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出状态自适应噪声轨迹调度器(SANTS),通过根据视频状态动态选择去噪深度来优化视频到动作的扩散策略,在保持控制性能的同时大幅降低推理延迟。

Comments 13 pages, 5 figures, 8 tables. Project page: this https URL (https://advanced-robotics-lab.github.io/SANTS/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10226 2026-08-27 cs.CV cs.RO 版本更新 79%

Latent Chain-of-Thought World Modeling for End-to-End Driving

潜在链式思维世界建模用于端到端驾驶

Shuhan Tan, Kashyap Chitta, Yuxiao Chen, Ran Tian, Yurong You, Yan Wang, Wenjie Luo, Yulong Cao, Philipp Krahenbuhl, Marco Pavone, Boris Ivanovic

机构 * UT Austin(得克萨斯大学奥斯汀分校) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Latent-CoT-Drive模型,通过潜在语言整合链式思维推理与决策,提升驾驶性能与安全性,实现更快推理和更优轨迹质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26058 2026-08-27 cs.RO 新提交 77%

One Policy, Many Embodiments: Unified Camera-Centric Action Geometry Pre-training for Heterogeneous Embodied Manipulation

单一策略,多种具现体:面向异构具身操纵的以相机为中心的统一动作几何预训练

Xiaomi Embodied Intelligence Team, University of Macau: Shaoqing Xu, Fang Li, Guozhi Zhan, Zhixiang Duan, Yuhan Wang, Yuechen Luo, Shengyin Jiang, Hanbing Li, Zhiying Du, Longlong Wang, Longmei Jiang, Weixiang Liang, Ying Gong, Yong Pan, Ziping Zhao, Zhiyuan Chen, Yangwei You, Kun Ma, Qinyuan Liu, Hangjun Ye, Zhi-xin Yang

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队) University of Macau(澳门大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 该研究针对异构具身操纵数据的问题,提出UCAG-P预训练方法,通过以相机为中心的统一动作公式对齐数据,在多个基准任务上取得优异性能,无需特定微调。

Comments Technical Report,Project page: this https URL (https://public-bots.github.io/UCAG-P)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25659 2026-08-27 cs.RO 新提交 77%

GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation

Yuqing Jiang, Zijian Zhang, Weitao Zhou, Jiawei Wang, Junjie He, Lei Yang, Haifang Qing, Si Liu, Ding Zhao, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);language-conditioned robot(abstract);分类 cs.RO

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22067 2026-08-27 cs.RO cs.AI cs.CV cs.LG 版本更新 77%

DELE-w0.5: Inferring Action from Future Latent State for Robotic Manipulation

从未来隐状态推断机器人操纵动作

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren

机构 * DeepLeap Research(DeepLeap研究院)

专题命中 VLA模型 :action model(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出无需视频生成的机器人操纵模型DELE-w0.5,通过从捕获动作相关物理结果的未来隐状态推断动作,在4项长程操纵任务的480次试验中,其性能优于最强基线47.5和30.7个百分点,实现最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25798 2026-08-27 cs.RO cs.LG 新提交 73%

TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

TacForcing:结合执行时触觉反馈的流式动作生成

Jianbo Zhou, Boyuan Zhao, Yuzheng Zhang, Yiyang Chen, Wenxin Chen, Qiuyue Li, Xiangyang Gu, Yuhan Cao, Xiao Xia, Yanzhe Hu, Zhijie Deng

机构 * School of Computer Science, SJTU(上海交通大学计算机科学学院) SCUT(华南理工大学) ECUST(华东理工大学) ECNU(华东师范大学) PolyU(香港理工大学) CCUT(长春工业大学) UESTC(电子科技大学) HUST(华中科技大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出TacForcing框架,通过流式动作专家结合执行时触觉反馈,并引入EATA减少时间不匹配,在模拟和真实接触操纵任务中均优于基线方法。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24922 2026-08-27 physics.chem-ph cond-mat.mtrl-sci 新提交 71%

Multi-Species Multi-Reaction Model Parametrization of a Commercial NCA Positive Electrode from Half-Cell Open-Circuit Potential Data

基于半电池开路电位数据的商用NCA正极的多物种多反应模型参数化

Michele Galasso, Petr Čech, Ivo Horstkötter, Simon Schwunk, Zuzana Vlčková Živcová, Václav Knap

专题命中 VLA模型 :action model(title)

AI总结 本研究通过半电池开路电位数据对商用NCA正极进行多物种多反应(MSMR)模型参数化,发现NCA正极热力学特征在老化中基本不变,支持固定电极固有参数、将老化归因于电极层面变化的建模方法。

Comments 21 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25395 2026-08-27 cs.RO 新提交 70%

A Taxonomy of Construction Task Activities for Robot Workers

机器人工人的施工任务活动分类学

Sadman Sakib, Zhangyi None Peng, Yujie Pang, Yu Otsuki, Mohammad Abdullah Al Faruque

机构 * University of California-Irvine(加利福尼亚大学欧文分校) UCInspire

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 该研究提出基于职业的TARCAT分类学,定义施工任务的动作基元,在机械臂上演示相关基元,为通用施工机器人开发提供通用词汇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25281 2026-08-27 math.OC eess.SY math-ph stat.ML 新提交 50%

Schrödinger Bridges over Kinetic Swarming Models

基于动力学蜂拥模型的薛定谔桥

Asmaa Eldesoukey, Md Zulfiqur Haider, Italo Napolitano, Yongxin Chen, Abhishek Halder

专题命中 VLA模型 :action model(abstract)

AI总结 该研究针对受随机扰动的惯性蜂拥,基于薛定谔桥理论,提出嵌套不动点方案求解最优控制,实现有限时间内将蜂拥群体引导至规定端点分布的目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14911 2026-08-27 cond-mat.soft physics.comp-ph 版本更新 50%

ESPResSo++: A Fast and Extensible Molecular Simulation Package for Coarse-Grained Models

ESPResSo++:面向粗粒化模型的快速可扩展分子模拟软件包

Zhen-Hao Xu, James Vance, Nikita Tretyakov, Sebastian Eibl, Pavel Kus, Jakub Krajniak, Tristan Bereau, Horacio V. Guzman, Bin Song, Markus Rampp, Torsten Stuehn, Christoph Junghans

专题命中 VLA模型 :action model(abstract)

AI总结 本文介绍了开源分子模拟软件ESPResSo++,其支持粗粒化模型,适配HPC环境,可并行模拟多种软物质体系。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2608.24111 2026-08-27 cs.RO 版本更新 57%

Trajectory-Level Continuous Action Representation for Robotic Manipulation

面向机器人操作的轨迹级连续动作表示

Tong Yang, Jingkai Jia, Yuecheng Xu, Xueyao Chen, Chi Zhang, Wenqiang Zhang

机构 * Fudan University(复旦大学) TeleAI, China Telecom(中国电信TeleAI)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 该研究提出CAT轨迹级连续动作表示框架,通过频率感知位置编码等技术解决现有视觉运动系统的动作表示冗余问题,在LIBERO等数据集上显著提升机器人操作任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 2 篇

2608.26103 2026-08-27 cs.RO cs.CV 新提交 81%

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

Zero-WAM:基于人类视频的上下文世界-动作建模用于开放式任务泛化

Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu

专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 Zero-WAM是基于人类视频的因果视频-动作模型,通过提出自动流水线构建HumanGen数据集、引入IFP目标,在RoboTwin 2.0仿真7个未见任务上平均成功率达47.0%,实现机器人操作零样本跨任务泛化。

Comments this https URL (https://robbyant-research.github.io/Zero-WAM/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22338 2026-08-27 cs.RO cs.AI cs.LG 版本更新 75%

RoboMME-Interference: Benchmarking Robot Memory Under Interference

干扰下的机器人记忆基准测试

Soumil Rathi

机构 * Independent Researcher(独立研究员)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 提出RoboMME-Interference基准,通过跨会话干扰评估机器人长期记忆能力,发现现有系统在干扰下性能显著下降。

Comments 9 pages, 5 figures. Updated results; added subgoal-memory systems

详情

展开后加载摘要…

URL PDF HTML 收藏