ByteScale: Efficient Scaling of LLM Training with a 2048K Context Length on More Than 12,000 GPUs
机构 * Peking University(北京大学)
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Comments 12 pages, 21 figures
Journal ref SIGCOMM 2025