arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-27 至 2026-08-27 共收录 8 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 6 篇

2602.00686 2026-08-27 cs.RO 版本更新 91%

Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching

通过自适应视觉令牌缓存学习加速视觉-语言-动作模型

Yujie Wei, Jiahan Fan, Jiyu Guo, Ruichen Zhen, Rui Shao, Xiu Su, Zeke Xie, Hongxun Yao, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院) Central South University(中南大学) HKUST(GZ)(香港科技大学(广州))

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出通过自适应视觉令牌缓存学习加速VLA模型,提升推理效率并提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22991 2026-08-27 cs.CV 版本更新 84%

Training-Free Interaction-Aligned Visual Token Pruning for Efficient Embodied Manipulation

VLA-IAP: 通过交互对齐实现无训练视觉令牌剪枝用于视觉-语言-动作模型

Jintao Cheng, Weibin Li, Haozhe Wang, Gang Wang, Yipu Zhang, Xiaoyu Tang, Jin Wu, Xieyuanli Chen, Yunhui Liu, Wei Zhang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) South China Normal University(华南师范大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) National University of Defense Technology(国防科技大学)

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.CV

AI总结 本文提出VLA-IAP方法,通过引入几何先验机制和动态调度策略,实现无训练的视觉令牌剪枝,提升VLA模型在资源受限平台上的推理效率和稳定性,实验显示在LIBERO基准上成功率达97.8%且速度提升1.25倍。

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27947 2026-08-27 cs.RO 版本更新 79%

SANTS: A State-Adaptive Scheduler for World Action Models

SANTS:面向世界动作模型的状态自适应调度器

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Shiqin Dai, Xinyu Bing, Zhongxue Gan, Chunxu Tian

机构 * Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Deep Computing Era Technology Co., Ltd(深计算时代科技有限公司)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出状态自适应噪声轨迹调度器(SANTS),通过根据视频状态动态选择去噪深度来优化视频到动作的扩散策略,在保持控制性能的同时大幅降低推理延迟。

Comments 13 pages, 5 figures, 8 tables. Project page: this https URL (https://advanced-robotics-lab.github.io/SANTS/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10226 2026-08-27 cs.CV cs.RO 版本更新 79%

Latent Chain-of-Thought World Modeling for End-to-End Driving

潜在链式思维世界建模用于端到端驾驶

Shuhan Tan, Kashyap Chitta, Yuxiao Chen, Ran Tian, Yurong You, Yan Wang, Wenjie Luo, Yulong Cao, Philipp Krahenbuhl, Marco Pavone, Boris Ivanovic

机构 * UT Austin(得克萨斯大学奥斯汀分校) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Latent-CoT-Drive模型,通过潜在语言整合链式思维推理与决策,提升驾驶性能与安全性,实现更快推理和更优轨迹质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22067 2026-08-27 cs.RO cs.AI cs.CV cs.LG 版本更新 77%

DELE-w0.5: Inferring Action from Future Latent State for Robotic Manipulation

从未来隐状态推断机器人操纵动作

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren

机构 * DeepLeap Research(DeepLeap研究院)

专题命中 VLA模型 :action model(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出无需视频生成的机器人操纵模型DELE-w0.5,通过从捕获动作相关物理结果的未来隐状态推断动作,在4项长程操纵任务的480次试验中,其性能优于最强基线47.5和30.7个百分点,实现最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14911 2026-08-27 cond-mat.soft physics.comp-ph 版本更新 50%

ESPResSo++: A Fast and Extensible Molecular Simulation Package for Coarse-Grained Models

ESPResSo++:面向粗粒化模型的快速可扩展分子模拟软件包

Zhen-Hao Xu, James Vance, Nikita Tretyakov, Sebastian Eibl, Pavel Kus, Jakub Krajniak, Tristan Bereau, Horacio V. Guzman, Bin Song, Markus Rampp, Torsten Stuehn, Christoph Junghans

专题命中 VLA模型 :action model(abstract)

AI总结 本文介绍了开源分子模拟软件ESPResSo++,其支持粗粒化模型,适配HPC环境,可并行模拟多种软物质体系。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2608.24111 2026-08-27 cs.RO 版本更新 57%

Trajectory-Level Continuous Action Representation for Robotic Manipulation

面向机器人操作的轨迹级连续动作表示

Tong Yang, Jingkai Jia, Yuecheng Xu, Xueyao Chen, Chi Zhang, Wenqiang Zhang

机构 * Fudan University(复旦大学) TeleAI, China Telecom(中国电信TeleAI)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 该研究提出CAT轨迹级连续动作表示框架,通过频率感知位置编码等技术解决现有视觉运动系统的动作表示冗余问题,在LIBERO等数据集上显著提升机器人操作任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 1 篇

2606.22338 2026-08-27 cs.RO cs.AI cs.LG 版本更新 75%

RoboMME-Interference: Benchmarking Robot Memory Under Interference

干扰下的机器人记忆基准测试

Soumil Rathi

机构 * Independent Researcher(独立研究员)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 提出RoboMME-Interference基准,通过跨会话干扰评估机器人长期记忆能力,发现现有系统在干扰下性能显著下降。

Comments 9 pages, 5 figures. Updated results; added subgoal-memory systems

详情

展开后加载摘要…

URL PDF HTML 收藏