Post-Trained MoE Can Skip Half Experts via Self-Distillation
Post-Trained MoE Can Skip Half Experts via Self-Distillation
机构 * Frontis.AI ; Kuaishou Technology(快手科技) ; Shanghai AI Lab(上海人工智能实验室) ; TsinghuaC3I/ZEDA(清华大学C3I/ZEDA)
AI总结 本文提出ZEDA框架,通过自蒸馏将预训练的静态MoE模型转换为高效的动态MoE模型,显著减少专家FLOPs并提升推理速度。