SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
SortedRL: 通过在线长度感知调度加速大语言模型的强化学习训练
机构 * National University of Singapore(新加坡国立大学) ; Microsoft Research Asia(微软亚洲研究院) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 SortedRL通过在线长度感知调度策略提升大语言模型强化学习训练效率,减少训练气泡比例并提升性能,实验表明在不同任务中表现优于基线。