机构
*
Purdue University(普渡大学)
;
University of Malaya(马来亚大学)
;
Faculty of Information Technology, Beijing University of Technology(北京理工大学信息学院)
;
School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学学院)
;
Department of Industrial and Systems Engineering, Lehigh University(莱斯大学工业与系统工程系)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
交替强化学习用于非可验证大语言模型后训练的评分标准建模
Ran Xu, Tianci Liu, Zihan Dong, Tony Yu, Ilgee Hong, Carl Yang, Linjun Zhang, Tao Zhao, Haoyu Wang
机构
*
Emory University(埃默里大学)
;
Purdue University(普渡大学)
;
Rutgers University(罗格斯大学)
;
Georgia Institute of Technology(佐治亚理工学院)
;
University at Albany(阿尔巴尼大学)