Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
梯度正则化减轻基于人类反馈和可验证奖励的强化学习中的奖励作弊
机构 * The University of Tokyo(东京大学) ; RIKEN AIP(理化学研究所AIP) ; Mila(蒙特利尔大学Mila)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);LLM(abstract);language model(abstract);post-training(abstract)
AI总结 研究基于人类反馈或可验证奖励的强化学习中奖励作弊问题,提出用梯度正则化使训练偏向奖励更准确区域,理论推导并实证验证,还改进方法,结果显示其比KL惩罚表现更好。
Comments Accepted at ICML 2026, 25 pages, 15 figures