PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
PCL-Reasoner-V1.5:通过离线强化学习推进数学推理
机构 * Peng Cheng Laboratory(鹏城实验室) ; Peking University(北京大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.AI、cs.LG
AI总结 PCL-Reasoner-V1.5通过离线强化学习方法,在数学推理任务中达到新高度,实现90.9%和85.6%的准确率。