IRPM: Intergroup Relative Preference Modeling for Pointwise Generative Reward Models
IRPM:基于组间相对偏好的点wise生成奖励模型
Haonan Song, Qingchen Xie, Huan Zhu, Feng Xiao, Luxi Xing, Liu Kang, Fuzhen Li, Zhiyong Zheng, Feng Jiang, Ziheng Li, Kun Yan, Qingyi Si, Yanghua Xiao, Hongcheng Guo, Fan Yang
机构
*
HUJING Digital Media \& Entertainment Group (XingYun Lab), Beijing, China
;
Department of Automation, Tsinghua University, Beijing, China
;
Fudan University, Shanghai, China
;
Beihang University, Beijing, China
;
Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China
CommentsComments: Updated title for clarity; improved theoretical derivations; added experiments at additional parameter scales and more ablations; added experimental details in the appendix; updated author list (added five co-authors) to reflect contributions to experiments and writing
机构
*
School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院)
;
NiuTrans Research, Shenyang, China(NiuTrans研究)
;
CAS Key Laboratory of Behavioral Science, Institute of Psychology, CAS, Beijing, China(中国科学院行为科学重点实验室)
;
Meituan Inc.(美团公司)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC研究院)
;
School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院)
;
ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学Hangzhou全球科技创新中心)
;
City University of Hong Kong(香港城市大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Renhao Li, Jianhong Tu, Yang Su, Yantao Liu, Fei Huang, Hamid Alinejad-Rokny, Derek F. Wong, Junyang Lin, Min Yang
机构
*
University of Macau(澳门大学)
;
Qwen Team, Alibaba Inc.(阿里云Qwen团队)
;
UNSW Sydney(新南威尔士大学悉尼分校)
;
Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Beyond Token-level Supervision: Unlocking the Potential of Decoding-based Regression via Reinforcement Learning
超越标记级监督:通过强化学习解锁解码回归的潜力
Ming Chen, Sheng Tang, Rong-Xi Tan, Ziniu Li, Jiacheng Chen, Ke Xue, Chao Qian
机构
*
National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)
;
School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学)
;
School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))
;
Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)
;
Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)
;
Amazon.com, Inc.(亚马逊公司)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Scalable Valuation of Human Feedback through Provably Robust Model Alignment
Masahiro Fujisawa, Masaki Adachi, Michael A. Osborne
机构
*
The University of Osaka(大阪大学)
;
Lattice Lab, Toyota Motor Corporation(丰田公司Lattice实验室)
;
Machine Learning Research Group, University of Oxford(牛津大学机器学习研究组)
;
RIKEN AIP(理化学研究所AIP)