Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching
通过自适应视觉令牌缓存学习加速视觉-语言-动作模型
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院) ; Central South University(中南大学) ; HKUST(GZ)(香港科技大学(广州))
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO
AI总结 本文提出通过自适应视觉令牌缓存学习加速VLA模型,提升推理效率并提高任务成功率。