arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-26 至 2026-08-26 共收录 11 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 10 篇

2608.24042 2026-08-26 cs.RO cs.AI cs.LG 新提交 91%

Hierarchical Skill Retrieval for Data-Efficient Adaptation of Vision-Language-Action Models

用于视觉-语言-动作模型数据高效适配的分层技能检索

Haoran Hao, Shahram Najam Syed, Jeff Schneider, Jeffrey Ichnowski

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 针对视觉-语言-动作模型在有限演示下适配性能下降的问题,提出分层技能检索框架,结合子任务语言检索与行为特征重排序,在LIBERO基准及真实机器人任务上提升平均成功率10.3%和21.3%。

Comments Project Page: this https URL (https://hoar012.github.io/HSR-Project)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24603 2026-08-26 cs.RO 新提交 90%

Gripper-aware Vision Language Action Models

感知夹具的视觉语言动作模型

Hanyi Zhang, Zihong Luo, Tianyu Li, Khang Nguyen, Basu Hela, Shreyas Kumar, Ngoc Duy Tran, Feng Dai, Charith Munasinghe, Jorge Peña Queralta, Giovanni Toffetti, Khoa Vo, Ngan Le, Ravi Prakash, Quan Vuong, Tung D. Ta, Long Hu, Anh Nguyen, Baoru Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Indian Institute of Science(印度科学学院) The University of Tokyo(东京大学) Zürcher Hochschule für Angewandte Wissenschaften(苏黎世应用科技大学) University of Arkansas(阿肯色大学) Physical Intelligence(物理智能公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 VLA模型 :vision language action(title,abstract);action model(title,abstract);VLA(summary_cn);分类 cs.RO

AI总结 针对现有视觉语言动作模型(VLA)忽略夹具差异的问题,提出多夹具感知数据集MiGA与结合多夹具分词器及适配器策略路由的GVLA,实验显示其性能优于基线且泛化与适应能力更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24115 2026-08-26 cs.RO cs.AI 新提交 85%

PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control

PonderPounce:作为机器人控制回合上下文引擎的预训练多模态大语言模型(MLLM)

Suhwan Choi, Jaeyoon Jung, Sungkyung Kim, Yunsung Lee, Youngjae Yu

机构 * Seoul National University(首尔大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 PonderPounce复用预训练MLLM的因果上下文作为机器人记忆,由System2 MLLM(Ponder)和System1 VLA(Pounce)组成,在RoboMME、RoboCasa-DC等数据集上的性能优于现有基线,实现了低延迟的机器人控制。

Comments Project page: this https URL (https://worv-ai.github.io/ponderpounce/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24882 2026-08-26 cs.RO 新提交 83%

Latent Action as Intention Enables Efficient Future Imagination for World Action Models

作为意图的隐式动作:为世界动作模型实现高效的未来想象

Xiang Li, Yupeng Zheng, Songen Gu, Huailiang Ma, Feng Yu, Xian Nie, Shanshuai Yuan, Yujie Zang, Weize Li, Shuai Tian, Moyang Liu, Ya-Qin Zhang, Wenchao Ding

机构 * CollegeAI, THU(清华大学CollegeAI) AIR, THU(清华大学AIR) CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人公司) FDU(复旦大学) Southeast University(东南大学) SJTU(上海交通大学) NUS(新加坡国立大学) BUAA(北京航空航天大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 本文提出名为 LAWA 的 WAM 架构,以紧凑隐式动作作为未来意图实现高效未来想象,在 RoboCasa 等数据集上优于 Fast-WAM,延迟更低且性能更优,兼顾性能、泛化性与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24714 2026-08-26 cs.RO 新提交 83%

GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models

GaussianWAM:将三维高斯场的几何与语义知识蒸馏至世界-动作模型

Zijian Zhang, Yuqing Jiang, Weitao Zhou, Minglei Li, Jinhao Zhang, Yao Mu, Xiaofan Li, Hao Zhao, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Simple AI(简智人工智能) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) The University of Hong Kong(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 GaussianWAM是训练时的表征增强框架,通过三维高斯场蒸馏几何与语义监督,在LIBERO-Plus等任务上显著提升了WAM类模型的机器人操作性能,且不改变部署架构。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23927 2026-08-26 cs.CV 新提交 79%

GlanceWAM: Sparse Test-Time Imagination for World-Action Models

GlanceWAM:面向世界-动作模型的稀疏测试时想象方法

Linhan Wang, Zijian An, Mingyuan Zhang, Chen Dai, Yi Xu, Can Cui, Zichong Yang, Yinlin Chen, Lifeng Zhou, Chang-Tien Lu

机构 * Virginia Tech(弗吉尼亚理工大学) Drexel University(卓克索大学) Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 该研究提出GlanceWAM,通过异步解耦视频DiT的想象与控制,打破世界-动作模型的速度-成功率困境,在RoboCasa、LIBERO基准测试中表现优异,推理速度达48ms/块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24101 2026-08-26 cs.RO 新提交 77%

TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks

TrAct:通过视觉轨迹连接机器人控制与视觉预测

Zhi Cao, Howard Ji, Kevin Zhang, Kuangzhi Ge, Li Fei-Fei, Jiajun Wu, Huang Huang

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 TrAct是基于世界模型的机器人决策框架,以视觉轨迹为控制与预测的中间接口,在LIBERO-INTEGRAL基准和Franka任务上,相较基线π₀.5显著提升了操作成功率与视频预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24490 2026-08-26 astro-ph.HE astro-ph.GA 新提交 67%

Probing the Three-Dimensional Structure of a Jet with Faraday Tomography

用法拉第层析成像探测喷流的三维结构

Sawera Gull, Masaya Kurogi, Keitaro Takahashi

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 该研究构建AGN喷流三维模型,通过法拉第层析成像探究喷流磁场与湍流的可观测特征,为解读相关偏振观测提供物理框架。

Comments Accepted for publication in Publications of the Astronomical Society of Japan (PASJ)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24524 2026-08-26 cs.SE cs.AI 新提交 57%

LumiXAI: A Modular Full-Stack Framework for Feature Attribution

LumiXAI:一个用于特征归因的模块化全栈框架

Alfio Ferrara, Lorenzo Gatta, Sergio Picascia, Elisabetta Rocchetti

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 LumiXAI是整合特征归因分析的模块化全栈框架,结合多类型归因与交互GUI,支持插件架构和多层级访问,实现归因分析的跨机器可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24631 2026-08-26 quant-ph cs.LG 新提交 57%

When Similarity Is Interaction-Driven: Quantum Kernels for Regime-Sensitive Learning

当相似性由交互驱动时:适用于状态敏感学习的量子核

Hanqiu Peng, Jianlong Lu, Ying Chen

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 针对相似性由变量交互主导的决策场景,提出基于纠缠泡利串特征映射的交互驱动量子核,经合成与真实欺诈检测基准验证,其预测性能优于多种经典核,且可在经典计算机上精确评估。

Comments 24 pages, 8 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2608.24111 2026-08-26 cs.RO 新提交 57%

Trajectory-Level Continuous Action Representation for Robotic Manipulation

面向机器人操作的轨迹级连续动作表示

Tong Yang, Jingkai Jia, Yuecheng Xu, Xueyao Chen, Chi Zhang, Wenqiang Zhang

机构 * Fudan University(复旦大学) TeleAI, China Telecom(中国电信TeleAI)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 该研究提出CAT轨迹级连续动作表示框架,通过频率感知位置编码等技术解决现有视觉运动系统的动作表示冗余问题,在LIBERO等数据集上显著提升机器人操作任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏