Efficient Hyperparameter Optimization for LLM Reinforcement Learning
大语言模型强化学习的高效超参数优化
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; China United Network Communications Group(中国联合网络通信集团)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出联合保真度超参数优化方法,通过同时调整模型大小和训练预算作为保真度,并集成早停策略和检查点机制,显著提升计算效率(每轮最高14.9倍)且性能提升5.8%-111.6%。
Comments 12 pages, 6 figures, accepted at ACL 2026