Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments preprint
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments preprint
机构 * Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA Bedford Health Care 机构) ; Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校信息与计算机科学学院) ; Miner School of Computer and Information Sciences, University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校计算机与信息科学学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
Comments 15 pages