ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models
ScheduleFree+: 将学习率自由和调度自由学习扩展到大型语言模型
机构 * FAIR at Meta Super-Intelligence Labs(Meta 超智能实验室)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)
AI总结 本文提出了一种学习率自由和调度自由的学习方法(ScheduleFree+),用于训练大型语言模型,该方法在大规模训练中显著优于传统的Warmup-Stable-Decay(WSD)调度方案,并证明了调度自由学习在长周期训练中的有效性。