When Data Is Scarce: Scaling Sparse Language Models with Repeated Training
当数据稀缺时:通过重复训练扩展稀疏语言模型
机构 * Eindhoven University of Technology(埃因霍温理工大学) ; University of Luxembourg(卢森堡大学) ; University of Twente(埃因霍温大学) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 预训练与数据 :language model(title);分类 cs.AI、cs.LG
AI总结 研究数据受限下稀疏训练的可扩展性,提出包含活跃参数、唯一标记、数据重复和稀疏度的缩放定律,发现稀疏训练可延迟数据饱和并改善资源权衡。
Comments Accepted at ICML2026