arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Salesforce

2026-07-03 至 2026-07-03 共收录 1
2607.01844 2026-07-03 cs.DC cs.AI 新提交

Mixture-of-Parallelisms: Towards Memory-Efficient Training Stack for Mixture-of-Experts Models

并行化混合:面向混合专家模型的内存高效训练栈

Xuan-Phi Nguyen, Shrey Pandit, Yiran Zhao, Semih Yavuz, Silvio Savarese, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 提出一种内存高效的MoE模型训练范式,结合多种并行技术,在有限硬件资源下实现万亿参数、百万上下文长度的无损训练,吞吐量比FSDP2基线提升4.7-8.2倍。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏