arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

2026-08-27 至 2026-08-27 共收录 1
2602.00686 2026-08-27 cs.RO 版本更新

Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching

通过自适应视觉令牌缓存学习加速视觉-语言-动作模型

Yujie Wei, Jiahan Fan, Jiyu Guo, Ruichen Zhen, Rui Shao, Xiu Su, Zeke Xie, Hongxun Yao, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院) Central South University(中南大学) HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出通过自适应视觉令牌缓存学习加速VLA模型,提升推理效率并提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏