Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training
追逐尾部:基于评分标准的奖励建模以实现大语言模型的后训练效果
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Scale AI, Inc.(Scale AI 公司) ; University of Chicago(芝加哥大学)
AI总结 本文提出基于评分标准的奖励建模方法,通过关注高奖励区域以缓解大语言模型强化微调中的奖励过度优化问题,并实现有效的后训练改进。
Comments In ICLR 2026