Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models
超越代理梯度:面向视觉-语言模型的完全可微分令牌剪枝
机构 * Shenzhen University of Advanced Technology(深圳大学先进技术学院) ; CUHK MMLab(香港中文大学MMLab) ; CPII under InnoHK(创新工场CPII)
专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract)
AI总结 提出DiffPrune方法,通过将剪枝重新表述为令牌信息的连续控制而非离散选择学习,利用信息节流阀调节令牌,实现完全可微分的令牌重要性学习,在保持96.5%全模型精度的同时将LLM预填充加速2.85倍。