A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs
用于稀疏专家混合模型LLM插拔式负载平衡的复制和量化策略
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Minnesota Twin Cities(明尼苏达大学双城分校) ; North Carolina State University(北卡罗来纳州立大学) ; Meta AI ; Stevens Institute of Technology(史蒂文斯理工学院)
AI总结 提出Replicate-and-Quantize策略,通过动态工作量重新平衡提升稀疏混合专家模型LLM的推理效率和稳定性。