Mixture-of-Parallelisms: Towards Memory-Efficient Training Stack for Mixture-of-Experts Models
并行化混合:面向混合专家模型的内存高效训练栈
机构 * Salesforce AI Research(Salesforce AI研究院)
AI总结 提出一种内存高效的MoE模型训练范式,结合多种并行技术,在有限硬件资源下实现万亿参数、百万上下文长度的无损训练,吞吐量比FSDP2基线提升4.7-8.2倍。
Comments Work in progress