The Curse of Depth in Large Language Models
深度在大语言模型中的诅咒
机构 * Westlake University(西湖大学) ; Emory University(埃默里大学) ; Dalian University of Technology(大连理工大学) ; University of Surrey(萨里大学) ; University of Oxford(牛津大学)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LayerNorm Scaling方法,通过缩放输出方差缓解深度诅咒,提升大语言模型的预训练和微调性能。
Comments Accepted by NeurIPS 2025