Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning
基于多目标强化学习的LLM预训练整体数据调度器
机构 * China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所) ; Renmin University of China(中国人民大学) ; Alibaba Group(阿里巴巴集团)
AI总结 提出HDS框架,将数据调度建模为连续控制空间的强化学习问题,利用SAC算法和融合数据质量、跨域影响及模型权重的多目标奖励函数,在The Pile上减少44%训练迭代达到同等困惑度,并在MMLU等任务上提升7.2%。
Comments Our code is at https://github.com/DANG-ai/LLM-Training-Holistic-Data-Schedule
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), Vol. 1, pp. 176-187, 2026