RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction
RRC:基于排序的奖励构造解锁LLM强化学习中的生成式奖励模型
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; NiuTrans Research(NiuTrans研究院) ; Institute of Psychology, CAS(中国科学院心理研究所) ; Kunming University of Science and Technology(昆明理工大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL、cs.LG
AI总结 本研究针对生成式奖励模型在LLM强化学习中潜力未充分发挥的问题,提出RRC方法,通过两种互补策略提升RL训练效果,在多基准上取得一致增益。