On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
在预训练、中训练和强化学习对推理语言模型的相互作用中
机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)
AI总结 研究探讨了预训练、中训练和强化学习在推理语言模型中的相互作用,发现RL需预训练留有余地才能提升能力,中训练提升性能,过程级奖励提高推理准确性。