End-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference
端到端动态稀疏性用于资源自适应的大语言模型推理
机构 * Meta AI ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 提出L2A框架,通过预算条件和输入感知的门控网络,实现层跳过、头剪枝和推理令牌减少的资源自适应推理,在Llama-3-8B和Qwen-3-4B上达到34%层稀疏性且性能损失小于0.6%。