arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-09-01 至 2026-09-01 共收录 19 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 17 篇

2605.30117 2026-09-01 cs.AI 版本更新 94%

VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing

VLA-Trace: 通过表示与行为追踪诊断视觉-语言-动作模型

Haoyuan Shi, Xiancong Ren, Yingji Zhang, Qinfan Zhang, Jiayu Hu, Haozhe Shan, Han Dong, Jinpeng Lu, Yinda Chen, Yi Zhang, Yong Dai, Xiaozhu Ju

机构 * University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Beihang University(北航) Fudan University(复旦大学) University of New South Wales(新南威尔士大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.AI

AI总结 提出VLA-Trace诊断框架,通过表示演化、因果控制归因和行为表现分析,揭示VLA模型在多模态知识向具身控制转化中的机制,发现不同模型在微调适应、多模态路由和语义遵循上的差异与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24622 2026-09-01 cs.CV cs.AI 版本更新 93%

CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies

CF-VLA:面向视觉-语言-动作策略的高效粗到细动作生成

Fan Du, Feng Yan, Jianxiong Wu, Xinrun Xu, Weiye Zhang, Weinong Wang, Yu Guo, Bin Qian, Zhihai He, Fei Wang, Heng Yang

机构 * Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) United Nova Technology(联合Nova技术) University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CF-VLA,通过粗到细两阶段方法优化视觉-语言-动作策略的动作生成,提升效率与性能,在低NFE条件下实现更优的效率-性能平衡。

Comments Accepted to ACM Multimedia (ACM MM) 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13073 2026-09-01 cs.RO cs.CV 版本更新 92%

Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey

用于机器人操作的基于大型VLM的视觉-语言-动作模型:综述

Rui Shao, Wei Li, Lingsen Zhang, Renshan Zhang, Zhiyang Liu, Ran Chen, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术学院,哈尔滨工业大学(深圳))

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本综述首次系统分类梳理用于机器人操作的基于大型VLM的VLA模型,明确其定义与两类架构,考察其与先进领域的集成等内容,整合进展并提供更新项目页面

Comments Under Minor Revision at IEEE TPAMI, Project Page: https://github.com/JiuTian-VL/Large-VLM-based-VLA-for-Robotic-Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20754 2026-09-01 cs.RO 版本更新 89%

Perturbation-Based Epistemic Uncertainty for Failure Detection in Vision-Language-Action Models

基于扰动的视觉-语言-动作模型不确定性用于故障检测

Yousung Lee, Dongsoo Har

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出一种无标签、模型无关的扰动框架,通过注入高斯扰动到隐藏激活中估计认知不确定性,在分布偏移下提升故障检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08684 2026-09-01 cs.CV 版本更新 89%

BLUE: Toward Better Language Use in Efficient Vision-Language-Action Models for Autonomous Driving

BLUE:迈向自动驾驶高效视觉-语言-动作模型中更好的语言使用

George Ling, Lijin Yang, Hao Yang, Zhongzhan Huang

机构 * Bosch Research(博世研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出BLUE方法,通过轻量门控机制在视觉-语言-动作模型中按帧决定是否激活语言生成,实现性能提升和2.54倍推理加速。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28301 2026-09-01 cs.LG 版本更新 89%

LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models

LIBERO-Para:一种用于视觉语言动作模型中同义词鲁棒性诊断的基准和指标

Chanyoung Kim, Minwoo Kim, Minseok Kang, Hyunwoo Kim, Dahuin Jung

机构 * Soongsil University(崇实大学) Chung-Ang University(中央大学)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.LG

AI总结 本文提出LIBERO-Para基准,通过独立变化动作表达和物体参考,分析语言泛化能力。研究发现,不同规模的VLA模型在同义词替换下性能下降22-52个百分点,主要由物体层面的词汇变化导致。提出PRIDE指标量化同义词难度,揭示模型对任务识别的依赖。

Comments Accepted to EMNLP 2026 (Main Conference). Code and benchmark: https://github.com/cau-hai-lab/LIBERO-Para

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10860 2026-09-01 cs.RO cs.CV 版本更新 84%

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

Flex-$π$:具备计算灵活性的多流世界-动作模型

Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究提出Flex-$π$多流世界-动作模型,利用冻结的视频生成VAE实现多模态监督,通过混合专家Transformer与每流丢弃机制提升效率,在双臂操作任务上性能优于基线模型且运行更快。

Comments Project page: https://flex-pi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-09-01 cs.RO cs.AI cs.CL cs.CV 版本更新 83%

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments EMNLP 2026 Main Conference, Code can be found at https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08283 2026-09-01 cs.RO 版本更新 81%

TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning

TFP:用于视觉运动学习的时间条件记忆融合策略

Yushen Liang, Yue Peng, Baosheng Jin, Tianluo Zhang, Xinyu Zhang, Shuyi Zhou, Zhuoran Chen, Xinqi Liu, Shenji Wan

机构 * University of Electronic Science and Technology of China(电子科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO

AI总结 研究针对视觉运动学习中阶段依赖操作问题,提出时间条件记忆融合策略(TFP),通过维护任务进展信念并注入动作解码器来改进VLA策略,在多个任务上提升成功率,证明紧凑且对事件敏感的记忆动态可优化VLA策略。

Comments Accepted to the SemRob 2026 Workshop at Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26673 2026-09-01 cs.RO 版本更新 77%

PredVLA: Predictive Sensorimotor Modeling for Sub-Million-Parameter Robot Manipulation

PredVLA:用于机器人操作的亚百万级参数预测编码策略

Hiroki Sawada, Shunichi Kasahara

机构 * Sony Computer Science Laboratory(索尼计算机科学实验室)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);language-conditioned robot(abstract);分类 cs.RO

AI总结 PredVLA是仅0.68M参数的无机器人数据预训练预测编码策略,在LIBERO基准上远超参数匹配的Transformer、LSTM策略,实现强语言条件机器人操作性能且具备显式在线修正机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24101 2026-09-01 cs.RO 版本更新 77%

TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks

TrAct:通过视觉轨迹连接机器人控制与视觉预测

Zhi Cao, Howard Ji, Kevin Zhang, Kuangzhi Ge, Li Fei-Fei, Jiajun Wu, Huang Huang

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 TrAct是基于世界模型的机器人决策框架,以视觉轨迹为控制与预测的中间接口,在LIBERO-INTEGRAL基准和Franka任务上,相较基线π₀.5显著提升了操作成功率与视频预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22067 2026-09-01 cs.RO cs.AI cs.CV cs.LG 版本更新 77%

DELE-w0.5: Inferring Action from Future Latent State for Robotic Manipulation

从未来隐状态推断机器人操纵动作

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren

机构 * DeepLeap Research(DeepLeap研究院)

专题命中 VLA模型 :action model(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出无需视频生成的机器人操纵模型DELE-w0.5,通过从捕获动作相关物理结果的未来隐状态推断动作,在4项长程操纵任务的480次试验中,其性能优于最强基线47.5和30.7个百分点,实现最优表现。

Comments DeepLeap Technology Co., Ltd., Shenzhen, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20743 2026-09-01 cs.AI 版本更新 77%

Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis

多模态推测解码是否适用于基于扩散的并行草稿生成?一项调查与实证诊断

Yantao Li, Huanlin Gao, Fang Zhao, Chao Tan, Qiang Hui, Shuting Liu, Fuyuan Shi, Ting Lu, Shaoan Zhao, Xueqiang Guo, Xinpei Su, Jianbing Zhang, Xinyu Dai, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通数据智能)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.AI

AI总结 本文通过调查多模态模型并开展跨架构实证研究,探究多模态推测解码是否适用于基于扩散的并行草稿生成,提出统一分类法并分析现有方法的局限性与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12564 2026-09-01 cs.LG 版本更新 70%

Scaling Automatic Research Agents via World Models

通过世界模型扩展自动研究智能体

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Xing Fan, Chenlei Guo, Jingrui He, Zhenyu Liao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.LG

AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00269 2026-09-01 cs.AI 版本更新 57%

Mnemosyne: Agentic Transaction Processing for Validating and Repairing AI-generated Workflows

Mnemosyne: 用于验证和修复AI生成工作流的代理事务处理

Edward Y. Chang, Longling Geng

机构 * Stanford University(斯坦福大学) QuadriumAI

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 提出代理事务处理(ATP)模型,将生成动作视为不可信提案,通过确定性约束集验证后才提交,并实现运行时修复,确保状态正确性独立于生成层。

Comments 60 pages, added additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04577 2026-09-01 astro-ph.GA astro-ph.HE 版本更新 50%

From NVSS to RACS: Identifying truly Compact Galactic and Extragalactic sources with Steep Spectra

从NVSS到RACS:识别真正紧凑且陡谱的射电源

Rajat Shinde, Yogesh Maan, Apurba Bera

专题命中 VLA模型 :VLA(abstract)

AI总结 本文利用RACS数据识别紧凑陡谱射电源,发现部分源在NVSS未被检测到,揭示了高红移射电星系等天体的研究价值。

Comments 16 pages, 6 figures, accepted for publication in PASA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16299 2026-09-01 cs.IR 版本更新 50%

MICE: Minimal Interaction Cross-Encoders for efficient Re-ranking

MICE:用于高效重排的最小交互交叉编码器

Mathias Vast, Victor Morand, Josiane Mothe, Benjamin Piwowarski

专题命中 VLA模型 :action model(abstract)

AI总结 研究针对交叉编码器推理成本高的问题,提出MICE架构,通过去除有害或不必要交互,将加速交叉编码器推理与提升一级检索效果两种方法结合,评估显示其降低推理延迟四倍,效果良好。

Comments 9 pages, 5 figures. Accepted as a Main Conference paper to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2604.03540 2026-09-01 cs.RO 版本更新 57%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

Comments Accepted at the 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07837 2026-09-01 cs.RO 版本更新 57%

RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AI

RLinf-USER: 一个统一且可扩展的系统,用于具身人工智能中的现实世界在线策略学习

Hongzhi Zang, Shu'ang Yu, Hao Lin, Tianxing Zhou, Zefang Huang, Zhen Guo, Xin Xu, Jiakai Zhou, Yuze Sheng, Shizhe Zhang, Feng Gao, Wenhao Tang, Yufeng Yue, Quanlu Zhang, Xinlei Chen, Chao Yu, Yu Wang

专题命中 动作表示与策略 :VLA(abstract_cn);分类 cs.RO

AI总结 RLinf-USER是一个统一且可扩展的系统,用于现实世界中的在线策略学习,通过统一硬件抽象层和异步框架实现多机器人协调与长时训练。

Comments Accepted to RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏