RLP: Reinforcement as a Pretraining Objective
RLP:将强化学习作为预训练目标
机构 * NVIDIA(英伟达) ; Carnegie Mellon University(卡内基梅隆大学) ; Boston University(波士顿大学) ; Stanford University(斯坦福大学)
AI总结 RLP通过将强化学习的探索精神引入预训练阶段,提升模型在数学和科学任务中的推理能力。
Comments ICLR 2026 camera ready