AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization
AdaFuse: 通过令牌级预门控和融合内核优化加速动态适配器推断
AI总结 AdaFuse通过令牌级预门控和融合内核优化,显著降低动态适配器推断延迟,提升LLM的推理效率。
Comments Accepted to AAAI 2026. arXiv admin note: substantial text overlap with arXiv:2405.17741