arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

无内爆的MoE基于速率的调度

Incast-Free MoE Rate-Based Scheduling

Evyatar Cohen, Jose Yallouz, Alexander Shpiner, Mark Silberstein, Sylvia Ratnasamy, Isaac Keslassy

arXiv 2607.26340首次发表:更新:

发表机构

Technion; Nvidia; UC Berkeley(以色列理工学院; 英伟达公司; 加州大学伯克利分校)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

针对MoE架构轮询调度引发的指数级内爆瓶颈,提出主动公平调度框架,可消除内爆、维持高链路利用率并降低集体完成时间。

AI 中文摘要

混合专家(MoE)架构已成为大型语言模型的核心;然而,其典型的轮询(RR)调度会引发严重瓶颈。本文表明,RR会导致MoE流量出现此前未被发现的指数级内爆现象。我们提出一种专为MoE工作负载设计的主动公平调度框架,可有效防止 fabric 过度订阅,还概述了其在网卡(NIC)中的实现方式。最后,通过真实与合成工作负载的大量模拟,我们证明该框架能持续消除内爆,维持近100%的链路利用率,并降低集体完成时间(CCT)。

英文摘要

Mixture of Experts (MoE) architectures have become key to large language models; however, their typical round-robin (RR) scheduling introduces significant bottlenecks. In this paper, we demonstrate that RR causes a previously-undiscovered exponential incast phenomenon with MoE traffic. We propose an alternative proactive fair scheduling framework tailored for MoE workloads, which effectively prevents fabric oversubscription. We also outline how it can be implemented in NICs. Finally, through extensive simulations with real and synthetic workloads, we demonstrate that this framework consistently eliminates incast, maintains a near-100% link utilization, and reduces Collective Completion Time (CCT).

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑