Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense
机构 * FAIR at Meta(Meta 的 FAIR) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG
Comments 21 pages
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
机构 * FAIR at Meta(Meta 的 FAIR) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG
Comments 21 pages
机构 * University of Waterloo(滑铁卢大学) ; Sea AI Lab(Sea AI 实验室) ; University of Toronto(多伦多大学) ; Shanghai University(上海大学) ; HKUST(香港科技大学) ; M-A-P ; National University of Singapore(新加坡国立大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
Comments 32 pages, 5 figures, 13 tables
机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院) ; Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) ; Guangdong Lab of AI and Digital Economy (SZ), China(广东人工智能与数字经济实验室(深圳)) ; Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)) ; School of Information Technology, Carleton University, Canada(卡尔顿大学信息科技学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
Comments 24 pages, 9 figures