It Takes a Good Model to Train a Good Model: Generalized Gaussian Priors for Optimized LLMs
要训练一个好的模型,需要一个好的模型:通用高斯先验用于优化的大型语言模型
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Electrical and Computer Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) ; Computer Science, New York University Shanghai(纽约大学上海分校计算机科学系)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于广义高斯分布的初始化和训练方法,通过减少冗余和通信开销,提升大型语言模型的训练效率和性能。