arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-26 至 2026-08-26 共收录 16 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 16 篇

2602.18532 2026-08-26 cs.CV cs.AI cs.RO 版本更新 92%

VLANeXt: Recipes for Building Strong VLA Models

VLANeXt: 构建强大VLA模型的配方

Xiao-Ming Wu, Bin Fan, Kang Liao, Jian-Jian Jiang, Runze Yang, Yihang Luo, Zhonghua Wu, Wei-Shi Zheng, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文通过统一框架和评估设置重新审视VLA设计空间,系统分析了基础组件、感知要素和动作建模视角,总结出12项关键发现,提出了一种简单有效的VLA模型VLANeXt,并在LIBERO和LIBERO-plus基准测试中超越了现有方法,同时提供了易于使用的代码库。

Comments Accepted in ICML 2026, Project Page: this https URL (https://dravenalg.github.io/VLANeXt/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13856 2026-08-26 cs.RO 版本更新 92%

Output-Level Regularization Eliminates the Seed Lottery in Single-GPU VLA Fine-Tuning

输出级正则化消除单GPU VLA微调中的种子彩票

Jeffrin Sam, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology (Skoltech)(斯科尔科沃科学技术研究所)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 发现单GPU微调VLA-JEPA时存在种子彩票现象(随机种子导致性能骤降29%),归因于输出坍塌,提出输出级正则化(VICReg、Dropout、减半学习率)可完全消除该问题。

Comments Some errors in the reference, and Im still developing to make it more novel

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10426 2026-08-26 cs.CV cs.AI 版本更新 91%

CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving

CoWorld-VLA:面向自动驾驶的多专家世界模型中的思考

Minqing Huang, Yujiao Xiang, Zihan Liang, Jiajie Huang, Jingqi Wang, Yuheng Zhou, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang, Gong Che

机构 * Afari Intelligent Drive(Afari智能驾驶公司) University of Electronic Science and Technology of China(电子科技大学) Shanghai Jiao Tong University(上海交通大学) Beijing University Of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CoWorld-VLA,通过多专家世界推理框架,利用显式条件指导动作规划,提升自动驾驶的场景生成与路径规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24042 2026-08-26 cs.RO cs.AI cs.LG 新提交 91%

Hierarchical Skill Retrieval for Data-Efficient Adaptation of Vision-Language-Action Models

用于视觉-语言-动作模型数据高效适配的分层技能检索

Haoran Hao, Shahram Najam Syed, Jeff Schneider, Jeffrey Ichnowski

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 针对视觉-语言-动作模型在有限演示下适配性能下降的问题,提出分层技能检索框架,结合子任务语言检索与行为特征重排序,在LIBERO基准及真实机器人任务上提升平均成功率10.3%和21.3%。

Comments Project Page: this https URL (https://hoar012.github.io/HSR-Project)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24603 2026-08-26 cs.RO 新提交 90%

Gripper-aware Vision Language Action Models

感知夹具的视觉语言动作模型

Hanyi Zhang, Zihong Luo, Tianyu Li, Khang Nguyen, Basu Hela, Shreyas Kumar, Ngoc Duy Tran, Feng Dai, Charith Munasinghe, Jorge Peña Queralta, Giovanni Toffetti, Khoa Vo, Ngan Le, Ravi Prakash, Quan Vuong, Tung D. Ta, Long Hu, Anh Nguyen, Baoru Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Indian Institute of Science(印度科学学院) The University of Tokyo(东京大学) Zürcher Hochschule für Angewandte Wissenschaften(苏黎世应用科技大学) University of Arkansas(阿肯色大学) Physical Intelligence(物理智能公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 VLA模型 :vision language action(title,abstract);action model(title,abstract);VLA(summary_cn);分类 cs.RO

AI总结 针对现有视觉语言动作模型(VLA)忽略夹具差异的问题,提出多夹具感知数据集MiGA与结合多夹具分词器及适配器策略路由的GVLA,实验显示其性能优于基线且泛化与适应能力更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23775 2026-08-26 cs.RO 版本更新 87%

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24115 2026-08-26 cs.RO cs.AI 新提交 85%

PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control

PonderPounce:作为机器人控制回合上下文引擎的预训练多模态大语言模型(MLLM)

Suhwan Choi, Jaeyoon Jung, Sungkyung Kim, Yunsung Lee, Youngjae Yu

机构 * Seoul National University(首尔大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 PonderPounce复用预训练MLLM的因果上下文作为机器人记忆,由System2 MLLM(Ponder)和System1 VLA(Pounce)组成,在RoboMME、RoboCasa-DC等数据集上的性能优于现有基线,实现了低延迟的机器人控制。

Comments Project page: this https URL (https://worv-ai.github.io/ponderpounce/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24882 2026-08-26 cs.RO 新提交 83%

Latent Action as Intention Enables Efficient Future Imagination for World Action Models

作为意图的隐式动作:为世界动作模型实现高效的未来想象

Xiang Li, Yupeng Zheng, Songen Gu, Huailiang Ma, Feng Yu, Xian Nie, Shanshuai Yuan, Yujie Zang, Weize Li, Shuai Tian, Moyang Liu, Ya-Qin Zhang, Wenchao Ding

机构 * CollegeAI, THU(清华大学CollegeAI) AIR, THU(清华大学AIR) CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人公司) FDU(复旦大学) Southeast University(东南大学) SJTU(上海交通大学) NUS(新加坡国立大学) BUAA(北京航空航天大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 本文提出名为 LAWA 的 WAM 架构,以紧凑隐式动作作为未来意图实现高效未来想象,在 RoboCasa 等数据集上优于 Fast-WAM,延迟更低且性能更优,兼顾性能、泛化性与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24714 2026-08-26 cs.RO 新提交 83%

GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models

GaussianWAM:将三维高斯场的几何与语义知识蒸馏至世界-动作模型

Zijian Zhang, Yuqing Jiang, Weitao Zhou, Minglei Li, Jinhao Zhang, Yao Mu, Xiaofan Li, Hao Zhao, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Simple AI(简智人工智能) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) The University of Hong Kong(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 GaussianWAM是训练时的表征增强框架,通过三维高斯场蒸馏几何与语义监督,在LIBERO-Plus等任务上显著提升了WAM类模型的机器人操作性能,且不改变部署架构。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23486 2026-08-26 cs.CV cs.RO 版本更新 81%

GeoWAM: Visual Geometry World Action Models for Autonomous Driving

GeoWAM:面向自动驾驶的视觉几何世界动作模型

Yiren Lu, Xin Ye, Jiaming Liu, Philip Jacobson, Jin Yao, Yi-chung Chen, Liam Merino, Dhruva Dixith Kurra, Min Cai, Tom Lampo, Yu Yin, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(优步自动驾驶实验室) Case Western Reserve University(凯斯西储大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究提出 GeoWAM,一种用于自动驾驶的视觉几何世界动作模型,通过预训练预测未来场景几何来学习动力学,经评估其生成的驾驶策略比图像基方案更强,确立未来几何预测为自动驾驶有效预训练目标。

Comments Project page: this https URL (https://yiren-lu.com/project_pages/geowam/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23927 2026-08-26 cs.CV 新提交 79%

GlanceWAM: Sparse Test-Time Imagination for World-Action Models

GlanceWAM:面向世界-动作模型的稀疏测试时想象方法

Linhan Wang, Zijian An, Mingyuan Zhang, Chen Dai, Yi Xu, Can Cui, Zichong Yang, Yinlin Chen, Lifeng Zhou, Chang-Tien Lu

机构 * Virginia Tech(弗吉尼亚理工大学) Drexel University(卓克索大学) Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 该研究提出GlanceWAM,通过异步解耦视频DiT的想象与控制,打破世界-动作模型的速度-成功率困境,在RoboCasa、LIBERO基准测试中表现优异,推理速度达48ms/块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24101 2026-08-26 cs.RO 新提交 77%

TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks

TrAct:通过视觉轨迹连接机器人控制与视觉预测

Zhi Cao, Howard Ji, Kevin Zhang, Kuangzhi Ge, Li Fei-Fei, Jiajun Wu, Huang Huang

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 TrAct是基于世界模型的机器人决策框架,以视觉轨迹为控制与预测的中间接口,在LIBERO-INTEGRAL基准和Franka任务上,相较基线π₀.5显著提升了操作成功率与视频预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22067 2026-08-26 cs.RO cs.AI cs.CV cs.LG 版本更新 77%

Inferring Action from Future Latent State for Robotic Manipulation

从未来隐状态推断机器人操纵动作

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren

机构 * DeepLeap Research(DeepLeap研究院)

专题命中 VLA模型 :action model(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出无需视频生成的机器人操纵模型DELE-w0.5,通过从捕获动作相关物理结果的未来隐状态推断动作,在4项长程操纵任务的480次试验中,其性能优于最强基线47.5和30.7个百分点,实现最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24490 2026-08-26 astro-ph.HE astro-ph.GA 新提交 67%

Probing the Three-Dimensional Structure of a Jet with Faraday Tomography

用法拉第层析成像探测喷流的三维结构

Sawera Gull, Masaya Kurogi, Keitaro Takahashi

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 该研究构建AGN喷流三维模型,通过法拉第层析成像探究喷流磁场与湍流的可观测特征,为解读相关偏振观测提供物理框架。

Comments Accepted for publication in Publications of the Astronomical Society of Japan (PASJ)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24524 2026-08-26 cs.SE cs.AI 新提交 57%

LumiXAI: A Modular Full-Stack Framework for Feature Attribution

LumiXAI:一个用于特征归因的模块化全栈框架

Alfio Ferrara, Lorenzo Gatta, Sergio Picascia, Elisabetta Rocchetti

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 LumiXAI是整合特征归因分析的模块化全栈框架,结合多类型归因与交互GUI,支持插件架构和多层级访问,实现归因分析的跨机器可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24631 2026-08-26 quant-ph cs.LG 新提交 57%

When Similarity Is Interaction-Driven: Quantum Kernels for Regime-Sensitive Learning

当相似性由交互驱动时:适用于状态敏感学习的量子核

Hanqiu Peng, Jianlong Lu, Ying Chen

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 针对相似性由变量交互主导的决策场景,提出基于纠缠泡利串特征映射的交互驱动量子核,经合成与真实欺诈检测基准验证,其预测性能优于多种经典核,且可在经典计算机上精确评估。

Comments 24 pages, 8 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏