arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-28 至 2026-08-28 共收录 15 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 15 篇

2608.26578 2026-08-28 cs.RO cs.CV 新提交 92%

TrapVLA: Trapping Vision-Language-Action Models in Configured Failure Modes

TrapVLA:将视觉-语言-动作模型困在配置好的故障模式中

Jun-Hui Liu, Kun-Yu Lin, Yi-Lin Wei, Xu-Han Chen, Yinghao Li, Zhuohao Li, Yuan-Ming Li, Qing Zhang, Xiaoyi Fan, Dongmei Jiang, Yan Li, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Pengcheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学) Jiangxing Intelligence (Guizhou) Technology Inc.(匠星智能(贵州)科技有限公司)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(summary_cn,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本研究针对VLA模型提出名为TrapVLA的后门攻击方法,通过配置故障诱捕任务诱导模型进入指定故障模式,构建了相关基准并验证了攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27384 2026-08-28 cs.RO 新提交 92%

FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference

FlashVLA:用于快速异步VLA推理的流式动作解码

Zekai Li, Jiaming Tang, Zhijian Liu

机构 * UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO

AI总结 FlashVLA是一种流式动作解码框架,通过分块因果注意力维护动作缓冲,实现低延迟、平稳异步的VLA推理,在单GPU上达≥30Hz控制频率且任务性能优异。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26821 2026-08-28 cs.RO 新提交 91%

TemporalFlow-VLA: Learning Physically Grounded Execution History for Long-Horizon Robot Manipulation

TemporalFlow-VLA:学习基于物理基础的执行历史以实现长 horizon 机器人操作

Jiarui Yang, Yehao Lu, Yuning Su, Yu Zhong, Yufeng Xie, Yazhou Zhang, Haiyu Lan, Kaixiang Lu, Peiwen Lin, Chuang Wang, Junwei Liang, Enyu Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学) Simon Fraser University(西蒙菲莎大学) AgiBot(云圣智能科技(上海)有限公司)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 TemporalFlow-VLA 针对长 horizon 机器人操作中视觉相似状态需不同动作的问题,通过物理监督学习紧凑执行历史,在 LIBERO、RoboTwin 等任务上取得优异性能,且部署无额外开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26243 2026-08-28 astro-ph.HE 新提交 89%

Radio Monitoring of the Changing-look AGN Mrk 590 I: VLA Observations Reveal A Bow-shock Driven Radio Brightening Event

变貌活动星系核 Mrk 590 的射电监测 I:甚大阵(VLA)观测揭示弓激波驱动的射电增亮事件

Gregory Walsh, Marianne Vestergaard, Daniel Lawther, Sandra Raimundo, Jun Yi Koay

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 本研究通过VLA观测发现,变貌AGN Mrk 590的射电增亮由弓激波驱动,其射电变异性与高能波段的吸积变事件无关联,揭示了变貌AGN行为机制的多样性。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27079 2026-08-28 cs.RO 新提交 84%

GRAFT: Grounded and Efficient Online Reinforcement Adaptation for Fine-Grained Robot Manipulation

GRAFT:面向精细机器人操作的 grounded 高效在线强化适应

Yibo Qiu, Haoliang Ye, Shu'ang Sun, Zan Huang, Ronald X Xu, Mingzhai Sun

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学部生物医学工程学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 GRAFT是一种高效在线VLA适应框架,通过特定视角视觉锚点聚焦任务相关线索,在四项生物医学操作任务中提升25个百分点成功率并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25757 2026-08-28 cs.RO cs.LG 版本更新 84%

LM-X: Explainable Action Modeling with Progress, Event, and Uncertainty Prediction for Generalist Robot Manipulation

LM-X:面向通用机器人操控的、具备进度、事件与不确定性预测能力的可解释动作建模方法

Jin Lou, Zhiyuan Jing, Andong Chen, Xupeng Wang, Yuan Xu, Yuexuan Li, Xingdong Zhu, Zhijie Zhu, Yingwei Ji, Wenpeng Nie, Yufei Liu, Boyang Xing, Lei Jiang, Yan Cui, Ying Chu, Jingxuan Zhu, Jingyi Li, Liangliang Chen, Jinyan Liu, Zhiqi Song, Jidong Zhang, Hongming Li, Yuchen Zhu

机构 * Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司) E-surfing Digital Life Technology Co., Ltd., China Telecom(中国电信天翼数字生活科技有限公司)

专题命中 VLA模型 :action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 LM-X是一种面向通用机器人操控的可解释动作建模方法,通过多尺度预测信号提升操控成功率,在RoboTwin2.0等任务上显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27259 2026-08-28 cs.LG 新提交 83%

Making Latent Evolution Explicit: Operator-Structured Transitions for World Action Models

显式化隐式演化:面向世界动作模型的算子结构化转移

Xiaoxiao Lu, Yunlong Dong, Jiahao Shi, Ye Yuan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Principia AI

专题命中 VLA模型 :action model(title,abstract);分类 cs.LG

AI总结 该研究提出隐式演化算子网络(LEON)作为WAMs的新型转移实现架构,通过算子结构建模隐式演化,在两类WAM范式下均提升了闭环性能与鲁棒性,确立了转移实现的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26200 2026-08-28 cs.AI cs.CV cs.LG 新提交 82%

GameWAM: A World Action Model for Video Games

GameWAM:面向电子游戏的世界动作模型

Yuncheng Guo, Zhanqiu Zhang, Yiwen Guo, Weijia Li

机构 * Fudan University(复旦大学) LIGHTSPEED(光速(企业名)) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 GameWAM是首个用于原生闭环游戏玩法和GUI控制的世界动作模型,通过并行生成过程实现世界-动作联合学习,实验表明其以更少原生动作达到竞争力任务成功率,还发现了LASI失效模式。

Comments 44 pages, 23 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22187 2026-08-28 cs.RO cs.CV 版本更新 81%

BehaviorWorldGen: Closing the Loop between Action Models and World Simulators via Controllable Behavior-Aware Structured World Generation

BehaviorWorldGen:通过可控行为感知结构化世界生成闭合动作模型与世界模拟器之间的循环

Jiaqi Wang, Zhuo Zhang, Haining Guan, Tingguang Zhou, Haowen Cui, ChuanYe Wang, Zhongyang Zhu, Yulong Zheng, Xuefeng Chen, Zhen Yang, Tianchen Deng, Feiyang Tan, Xiwu Chen, Hangning Zhou, Bo Dai, Lixia Shen, Xiyang Wang, Jiajun Zhu

机构 * AFARI World Model Team(AFARI世界模型团队)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 BehaviorWorldGen通过BehaviorFlow实现可控行为感知结构化世界生成,闭合驾驶动作模型与世界模拟器的循环,在多项任务上取得改进,尤其对困难交互场景效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27033 2026-08-28 cs.RO 新提交 79%

Riemann-1.0: An Embodied World Action Model for Physical AI

Riemann-1.0:面向物理人工智能的具身世界动作模型

Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao, Biao Jiang, Zile Wang, Yang Liu, Yangguang Li

机构 * Riemann Dynamics(黎曼动力公司)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 本研究提出Riemann-1.0具身世界动作模型,通过统一建模与渐进式具身预训练,在多个模拟及真实机器人操作基准任务中取得最优性能,实现大规模具身经验向可泛化机器人操作能力的转化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16153 2026-08-28 cs.RO 版本更新 79%

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07468 2026-08-28 cs.CV 版本更新 79%

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

SimWAM:一种用于端到端自动驾驶的简单世界动作模型

Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Yu Wu, Honglin Li, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science & Technology(华中科技大学) Dongfeng Research & Development Institute(东风研发院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 SimWAM是一种仅将视频生成用作训练信号的简单WAM,通过联合流匹配协同训练视频与动作专家,在NAVSIM上达91.5 PDMS且延迟更低,可零样本迁移至nuScenes,为高效自动驾驶提供可靠基线。

Comments The code and model weights are available at this https URL (https://github.com/H-EmbodVis/SimWAM/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26663 2026-08-28 cs.RO 版本更新 79%

Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention

Tactile-WAM:具有触觉非对称注意力的触觉感知世界动作模型

Siyu Wu, Linjing You, Junjie Zhu, Yaozu Liu, Huang Kaixiang, Chen Yonghang, Jituo Li, Changhao Zhang, Jian Liu, Hengshuo Chu, Qi Li, Hengshuang Zhao

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 针对接触丰富操作中视觉预测不完整的问题,提出Tactile-WAM,通过触觉非对称注意力机制(TAAM)在保护视觉预测的同时利用触觉信息生成动作,整体成功率提升38.9%。

Comments Submitted to RSS2026 WorkShop Tactile for FM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26645 2026-08-28 cs.RO 新提交 70%

FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation

FLARE:一种面向视觉-语言机器人操纵中自主修正与恢复的故障感知框架

Ganlong Zhao, Zijia Tang, Xingping Chen, Zhanghui Kuang, Ye Tian, Guanbin Li

机构 * The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Duke University(杜克大学) Sun Yat-sen University(中山大学) TengenX(天工科技) Tencent Robotics X(腾讯Robotics X实验室) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对视觉-语言机器人操纵中VLAs无法从执行错误恢复的问题,提出含“重试”“重置”范式的FLARE框架,结合MLLM实现故障恢复,显著提升接触密集型操纵任务的成功率与鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26461 2026-08-28 astro-ph.GA 新提交 67%

A radio continuum view of Stephan's Quintet: age, dynamics and origin of the shock

斯蒂芬五重星系的射电连续谱视图:激波的年龄、动力学与起源

K. Rajpurohit, E. O'Sullivan, G. Schellenberger, A. Botteon, R. J. van Weeren, U. Lisenfeld, J. M. Vrtilek, L. P. David, S. Giacintucci, W. Forman, C. Jones, C. K. Xu, A. Togi

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 通过MeerKAT等多波段射电观测研究斯蒂芬五重星系,揭示射电脊的结构特征,确认其由NGC 7318B与潮汐气体丝碰撞产生的强激波形成,明确碰撞时间与运动方向。

Comments 25 pages, 13 Figures, Accepted for publication in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏