Teaching Large Language Models to Reason with Reinforcement Learning
Alex Havrilla, Yuqing Du, Sharath Chandra Raparthy, Christoforos Nalmpantis, Jane Dwivedi-Yu, Maksym Zhuravinskyi, Eric Hambro, Sainbayar Sukhbaatar, Roberta Raileanu
专题命中
后训练与偏好优化
:large language model(title);language model(title);LLM(abstract);SFT(abstract)
机构
*
Stanford University(斯坦福大学)
;
Georgia Institute of Technology(佐治亚理工学院)
;
The University of Tokyo(东京大学)
;
RIKEN AIP(日本理化学研究所智能系统研究中心)
;
Pennsylvania State University(宾夕法尼亚州立大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Harvard University(哈佛大学)
;
UNC–Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
Domyn-Small: A European 10B Reasoning Language Model
Domyn-Small:一个欧洲的100亿参数推理语言模型
Simone Angarano, Francesco Bertolotti, Federico D'Ambrosio, Michele Resta, Alessandro Rognoni, Nicolò Ruggeri, Dario Salvati, Andrea Valenti, Alberto Veneri, Martin Cimmino
机构
*
School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院)
;
Fudan University(复旦大学)
;
KAUST(卡塔尔人工智能研究学院)
;
Fuzhou University(福州大学)
专题命中
后训练与偏好优化
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
机构
*
HCCL, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学人工智能研究中心,香港,中国)
;
University of Cambridge, Cambridge, United Kingdom(剑桥大学,剑桥,英国)
;
MMLab, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学人工智能实验室,香港,中国)
;
Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)
专题命中
后训练与偏好优化
:LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI