DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models
DTP: 一种简单而有效的干扰令牌修剪框架用于视觉-语言动作模型
机构 * Australian National University(澳大利亚国立大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Chinese Academy of Sciences(中国科学院) ; Beijing Institute of Graphic Communication(北京印刷学院) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Baidu Search(百度搜索) ; Bytedance(字节跳动)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 DTP框架通过动态修剪干扰令牌提升视觉-语言动作模型的任务成功率,适用于多种新型VLA模型。