Complete-muE: Optimal Hyperparameter Transfer and Scaling for MoE Models
Complete-muE:MoE模型的最优超参数迁移与缩放
机构 * Adobe Research(Adobe研究院)
AI总结 提出Complete-muE框架,通过双桥系统实现稠密FFN与混合专家(MoE)架构间的超参数迁移,支持MoE模型在激活专家数、总容量、粒度等方面的缩放,并验证了“一次调优稠密模型,迁移至所有MoE配置”的实用策略。
Comments 27 pages