Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
保存好的前缀:通过过程监督强化学习实现精确误差惩罚以增强大语言模型推理
机构 * Tencent AI Lab(腾讯AI实验室) ; University of Virginia(弗吉尼亚大学) ; University of Notre Dame(圣母大学) ; University of Maryland(马里兰大学)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 通过过程监督强化学习实现精确误差惩罚,提升大语言模型推理能力。