Not-Just-Scaling Laws: Towards a Better Understanding of the Downstream Impact of Language Model Design Decisions
并非仅仅的规模法则:迈向更深入理解语言模型设计决策对下游影响的探索
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Language Technologies Institute(语言技术研究所) ; Instituto Superior Técnico (Lisbon ELLIS Unit)(里斯本ELLIS单位(理工学院)) ; Instituto de Telecomunicações(电信研究所) ; NEC Laboratories Europe, Germany(德国NEC欧洲实验室) ; CAIR, Ss. Cyril and Methodius University of Skopje, North Macedonia(北马其顿斯·西里尔和方法ius大学)
AI总结 本研究通过分析92个开源预训练模型,发现结合模型大小和训练token数量以外的特征,可提升对下游性能预测能力,揭示了数据组成和架构决策对模型性能的影响。