arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-09-01 至 2026-09-01 共收录 27 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 20 篇

2608.29208 2026-09-01 cs.RO cs.LG 新提交 92%

AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models

AdaVLA:用于无需训练的视觉-语言-动作模型加速的自适应步长流匹配

Sunghwan Han, Youngtae Han, Youngmin Yi

机构 * Sogang University(西江大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.LG

AI总结 本研究提出AdaVLA,一种无需训练的自适应框架,通过流匹配轨迹曲率度量动态调整推理步骤与MLP剪枝率,在LIBERO基准等测试中实现VLA模型加速且性能下降可忽略。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29967 2026-09-01 cs.RO cs.AI 新提交 92%

Training-Free Action Correction for VLA Model Failures via Language Feedback

无需训练的、基于语言反馈的VLA模型错误动作校正方法

Owen Kwon, Pablo Ortega-Kral, Arthur Bucker, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 该研究提出CorrectVLA框架,利用任务级自然语言反馈在不重训的情况下校正VLA模型的执行错位错误,在仿真与真实机器人实验中均实现了良好的泛化校正效果,明确了推理阶段动作校正的适用边界。

Comments 8 pages, 6 figures. Project page: https://correctvla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30122 2026-09-01 cs.CV cs.AI cs.LG 新提交 91%

Aligning Multi-Trajectory Supervision with Policy Optimization for VLA Driving

面向视觉-语言-动作(VLA)驾驶的多轨迹监督与策略优化对齐

Tian Zhang, Zhuo Huang, Hongrui Ye, Yu Wu, Zengmao Wang, Kaixuan Zhou

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Dongfeng Research & Development Institute(东风研发院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对VLA驾驶中多轨迹与GRPO不对齐的问题,本文提出对齐框架,引入两种互补机制,在NAVSIM数据集上取得优于GRPO基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29537 2026-09-01 cs.RO cs.AI 新提交 91%

AGM: Achievement-Grounded Memory for Closed-Loop Agents with Frozen VLA Policies

AGM:基于成就的闭环智能体记忆,适用于冻结的视觉-语言-动作(VLA)策略

Hongbo Gao, Zeyu Ni, Xin Wen, Siyu Xu, Ruifeng Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) The University of Sydney(悉尼大学) StellarEdge AI(星边人工智能)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 针对冻结VLA策略无法跟踪任务进度的问题,提出AGM框架,通过物理证据验证子目标实现闭环,在RoboMME基准和物理机器人上均取得显著性能提升。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28656 2026-09-01 cs.RO cs.CV 新提交 91%

RedLight-VLA: Models for traffic-rule grounding and behavioral emphasis in driving policies

RedLight-VLA:用于驾驶策略中交通规则落地与行为强化的模型

Bala Murali Manoghar Sai Sudhakar, Sourab Bapu Sridhar, Sandipan Das, Rahul Ahuja, Meda Lazar, Ashish Garg, Pratik Likhar, Senthil Yogamani

机构 * Qualcomm Technologies, Inc.(高通技术公司) Qualcomm Auto Ltd Sweden(瑞典高通汽车有限公司) Qualcomm India Private Limited(高通印度私人有限公司) Arriver System Software S.r.l.(Arriver系统软件有限公司)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 针对行为克隆VLA驾驶策略在信号交叉口罕见规则操作上的不足,提出RedLight-VLA,通过行为重加权与并行辅助头结合,提升交通规则落地能力,在多位移指标上优于基线及单独机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30144 2026-09-01 cs.RO 新提交 91%

Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving

重新思考语言在自动驾驶高效视觉-语言-动作(VLA)模型中的作用:迈向更智能、可信的驾驶

Tongfei Guo, Lili Su

机构 * Northeastern University(东北大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本研究针对自动驾驶VLA模型的高推理开销问题,提出语言残差分类法梳理高效语言使用方法,在多基准上分析适配性,将发布相关代码仓库。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29432 2026-09-01 cs.RO 新提交 91%

SMILE: Smooth Motion for Improved Long-Horizon VLA Execution

SMILE:用于改进长视界视觉-语言-动作(VLA)执行的平滑运动

Jongwoo Park, E-Ro Nguyen, Kanchana Ranasinghe, Cristina Mata, Xiang Li, Michael S Ryoo

机构 * Stony Brook University(石溪大学) Salesforce AI Research(Salesforce AI研究院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 SMILE是一种保留架构的接口,通过预测B样条系数生成平滑动作序列,应用于多款VLA模型后,在多个基准及真实实验中提升了长视界VLA执行的准确率与效率

Comments Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29583 2026-09-01 cs.SE 新提交 90%

Drive the Thoughts: Runtime Monitoring of VLA Reasoning-Trajectory Consistency

驱动思考:VLA推理-轨迹一致性的运行时监测

Tian Yu, Lu Feng, Sebastian Elbaum

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract)

AI总结 本文研究VLA的CoT能否支持AV的运行时监测,构建了DriveAlignBench数据集,提出带GPT-5.5的车道相关F-LLM监测器,F1达0.75并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29828 2026-09-01 eess.SY cs.SY 新提交 89%

SymVD: Symmetric Vision Language Action Distillation for Robot Manipulation

SymVD:面向机器人操作的对称视觉语言动作蒸馏

Hyewon Choi, Donggyu Kim, Soojean Han

专题命中 VLA模型 :VLA(summary_cn,abstract);vision language action(title);vision-language-action(abstract,abstract_cn)

AI总结 SymVD是利用操作任务几何对称性的VLA蒸馏框架,采用等变actor-critic架构与自适应加权方案,提升了机器人操作任务的样本效率与泛化能力,优于标准蒸馏及SAC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30643 2026-09-01 cs.RO 新提交 89%

Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models

时序强制:面向视觉-语言-动作模型的四维表示对齐

Xingyu Ding, Yuzhong Zhao, Chunhai Zhao, Yinghuan Shi, Chaoyang Zhao, Yifan Zhang

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 该研究针对视觉-语言-动作模型缺乏时序信息的问题,提出 Temporal Forcing 方法,通过历史通路与时序一致的四维几何特征对齐,在 LIBERO 等任务上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29749 2026-09-01 cs.RO 新提交 89%

DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

DriftingVLA:基于逐维度时序漂移的原生单步视觉-语言-动作生成模型

Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) LYNSENSE(灵犀科技)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO

AI总结 DriftingVLA是基于逐维度时序漂移的原生单步VLA模型,通过单步生成动作块,在多个机器人任务上优于基线模型,同时实现3.36倍的动作块生成加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30289 2026-09-01 cs.RO 新提交 84%

CometVLA: Co-Training on an Embodied Data Pyramid towards Physical Understanding

CometVLA:基于具身数据金字塔的协同训练以实现物理理解

Hanwen Wan, Dafeng Chi, Linbo Zhai, Tianao Shen, Yuzheng Zhuang, Tianle Zhang, Peidong Liu, Liang Lin, Xiaoqiang Ji

机构 * JD Explore Academy(京东探索研究院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳市人工智能与机器人研究院) South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 该研究提出CometVLA,通过构建与机器人动作对齐的具身物理VQA数据及引入GAP token,在具身数据金字塔上协同训练,提升VLA模型的物理理解能力,显著优于基线模型并验证了物理预训练对下游操作的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28995 2026-09-01 cs.RO cs.CV 新提交 81%

Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution

Hydra:一种具有离散潜在规划与连续流匹配执行能力的导航世界动作模型

Mohammad Nazeri, Alexandyr Card, Samira Huber, Anuj Pokhrel, Yujun Wang, Ruben Hammele, Daeun Song, Sören Pirk, Xuesu Xiao

机构 * George Mason University(乔治梅森大学) Kiel University(基尔大学) Ludwig Maximilian University Munich(慕尼黑大学) Ewha Womans University(梨花女子大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出Hydra模型,通过将规划器移入模型内部消除生成模型与规划器的表示不对齐问题,结合离散潜在规划与条件流匹配,在物理机器人平台上的目标导向规划与闭环执行能力表现优异。

Comments 29 pages, 12 figures. https://robotixx.github.io/hydra

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30955 2026-09-01 cs.AI 新提交 79%

Learning Action Models with Conditional and Quantified Effects via Uncertainty-Guided Exploration

通过不确定性引导的探索学习具有条件和量化效果的动作模型

Jeffrey Jewett, William Solow, Sandhya Saisubramanian

机构 * Oregon State University(俄勒冈州立大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 研究针对现有动作模型学习方法难以处理条件与量化效果的问题,提出OHCAM方法,通过不确定性引导探索学习动作模型,在基准领域与机器人任务中验证其样本效率与现实适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30702 2026-09-01 cs.CL cs.AI cs.LG 新提交 62%

An Agentic Retrobiosynthesis Framework with Learned Frontier Selection

一种基于学习的前沿选择的智能体逆生物合成框架

Philippe Meyer, Guillaume Gricourt, Thomas Duigou, Joan Hérisson, Jean-Loup Faulon

机构 * Université Paris-Saclay(巴黎萨克雷大学) INRAE(法国国家农业食品与环境研究院) AgroParisTech(巴黎高科农业学院)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出基于学习前沿选择的智能体逆生物合成框架,经微调的Qwen2.5-7B策略在多个基准上优于MCTS等方法,可提升预算内逆合成搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29937 2026-09-01 cs.AI 新提交 57%

AcrossWAM1.0:A Modular Latent World-Action Stack for Compact Robot Policies

AcrossWAM1.0:用于紧凑机器人策略的模块化潜在世界-动作栈

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨物理人工智能机构) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 该研究针对LaWAM的耦合问题推出AcrossWAM1.0模块化潜在世界-动作栈,在LIBERO实验中实现高成功率,参数规模显著缩小,提供可审计的部署边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29622 2026-09-01 cs.MA cs.AI 新提交 57%

AgenticRag-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing

AgenticRag-R1:用于多步推理、检索与记忆的带栈式记忆的智能体强化学习

Xinke Jiang, Yue Fang, Zhibang Yang, Jiaran Gao, Zhixin Zhang, Tao Feng, Rihong Qiu, Wentao Zhang, Hongxin Ding, Ruizhe Zhang, Yongxin Xu, Yuheng Huang, Xu Chu, Junfeng Zhao, Yasha Wang

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 针对现有智能体RAG方法的奖励分配弱、偏向短程推理等问题,提出AgenticRag-R1框架,通过记忆栈等实现长程学习,在多类基准上性能优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31058 2026-09-01 cs.CL 新提交 50%

Improving Information Extraction with Learned Queries

利用学习到的查询改进信息抽取

Omar Sharif, Soroush Vosoughi, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 VLA模型 :action model(abstract)

AI总结 该研究针对信息抽取问题,提出LoQ生成文档特定问题集、FeedQ反馈驱动优化方法,优化问题可训练轻量级模型,4B参数模型性能超未调大模型,发布12820个优化问题数据集。

Comments Accepted in EMNLP-2026, 21 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29926 2026-09-01 quant-ph 新提交 50%

Emergence of Strategic Equilibria from Transverse Field Ising Hamiltonian Dynamics

横向场伊辛哈密顿量动力学中策略均衡的涌现

Teena Thomas, S. Balakrishnan

专题命中 VLA模型 :action model(abstract)

AI总结 该研究基于横向场伊辛哈密顿量动力学,提出算子形式的量子博弈研究方法,通过可调纠缠算子解决博弈困境,获得优于经典结果的量子优势,为量子博弈设计提供硬件相关视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29701 2026-09-01 cond-mat.str-el 新提交 50%

Magnetic Field-Tunable Repulsive Exciton-Exciton Interaction in the van der Waals Antiferromagnet NiPS$_3$

范德华反铁磁体NiPS₃中磁场可调的排斥性激子-激子相互作用

Kaiyang Huang, Jaena Park, Zhuo Yang, Je-Geun Park, Atsuhiko Miyata, Yoshimitsu Kohama, Yasuhiro H. Matsuda

专题命中 VLA模型 :action model(abstract)

AI总结 本研究通过最高178 T的脉冲磁场磁光测量,发现NiPS₃中两个激子峰存在磁场可调的排斥耦合,为强关联激子物理研究提供了新平台。

Comments 8 pages, 7 figures

Journal ref Phys. Rev. Lett. 137, 076903, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 4 篇

2608.30536 2026-09-01 cs.RO 新提交 87%

Behavior-Skill: A Fine-Grained Benchmark for Evaluating Vision-Language-Action Policies in Long-Horizon Tasks

Behavior-Skill:用于评估长 horizon 任务中视觉-语言-动作策略的细粒度基准

Chunyun Ma, Lun Luo, Xingjian Luo, Xiexing Feng, Hang Zhang, Wei Liu, Feng Qiao, Yaonan Wang, Huimin Lu, Xieyuanli Chen

机构 * XPeng Inc.(小鹏汽车) The Chinese University of Hong Kong(香港中文大学) Hunan University(湖南大学)

专题命中 动作表示与策略 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.RO

AI总结 本研究提出细粒度基准 Behavior-Skill,含 235492 个技能实例,引入轨迹与技能级指标,实验发现接触丰富操作技能是长 horizon VLA 策略瓶颈,可用于分析改进该类策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30237 2026-09-01 cs.RO cs.AI cs.CV cs.LG 新提交 70%

Motus2: A Self-Evolving General World Model for Dexterous Manipulation

Motus2:一种用于灵巧操作的自进化通用世界模型

Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiabao Liu, Min Zhao, Fan Bao, Jun Zhu

机构 * GensPI Tsinghua University(清华大学) BUAA(北京航空航天大学) BIT(北京理工大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出Motus2,一种用于灵巧操作的自进化通用世界模型,通过模型缩放与数据缩放构建闭环决策学习循环,结合多模态数据与仿生平台实现通用具身智能体的灵巧操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30378 2026-09-01 cs.RO cs.AI 新提交 62%

PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies

PAVE:面向世界-动作策略的预测对齐与价值引导进化

Botong Zhao, Fang Yu, Tim, Senhua Zhu, Xinyuan Chen, Yue Lu

机构 * East China Normal University(华东师范大学) EBKernel Shanghai Artificial Intelligence Laboratory(上海人工智能实验室EBKernel)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本研究提出PAVE策略,通过多时间步转换对齐与分布价值评论者优化,在三个模拟基准中实现最优性能,同时保留在线直接动作生成路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29768 2026-09-01 cs.RO 新提交 57%

SmoothRL: Online Reinforcement Learning During Asynchronous Execution

SmoothRL:异步执行期间的在线强化学习

Guang Gao, Yuxuan Nong, Baifu Huang, Jianan Wang

机构 * Astribot Team(Astribot团队)

专题命中 动作表示与策略 :robot foundation model(abstract);分类 cs.RO

AI总结 SmoothRL是一种在异步推理循环内微调预训练策略的在线RL框架,通过显式建模异步推理过程优化策略,在高精度及高度动态机器人任务上实现有效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 2 篇

2608.29005 2026-09-01 cs.RO 新提交 57%

A Degradation-Tolerance Benchmark for Camera-Only End-to-End Driving

仅基于相机的端到端驾驶的抗退化基准测试

Haohua Que, Handong Yao

机构 * College of Engineering, University of Georgia(佐治亚大学工程学院)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO

AI总结 研究人员提出DriveDegrade基准测试,评估仅基于相机的端到端驾驶模型对各类图像退化的容忍度,发现不同退化对规划的影响差异显著,某视觉-语言-动作规划器被遮挡6个相机仅损失11.5%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28594 2026-09-01 cs.AI 新提交 57%

From Question-First to Analyst-First: Domain-Expert Skills and Verified Knowledge Compilation for Proactive Enterprise Analytics

从问题优先到分析师优先:面向主动企业分析的领域专家技能与验证知识编译

Harmohit Singh, Rahul Sharma

专题命中 数据集与评测 :action model(abstract);分类 cs.AI

AI总结 该研究提出了一种从问题优先转为分析师优先的主动企业分析系统,通过领域专家技能抽象与离线知识编译循环实现,无需查询日志,可生成验证过的报告与建议问题。

Comments 21 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 部署与泛化 1 篇

2608.29078 2026-09-01 cs.RO 新提交 86%

DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation

DREAM:基于实境到仿真的部署时演示生成,用于可扩展的策略适配

Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学)

专题命中 部署与泛化 :VLA(summary_cn,abstract);vision-language-action(abstract);language-conditioned robot(abstract);分类 cs.RO

AI总结 本研究提出DREAM框架,可无需人类演示生成VLA微调数据,经实机实验验证其能降低新工作空间的数据收集成本并提升操纵任务成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏