GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards
GRAIL: 基于梯度重加权优势的可验证奖励强化学习
机构 * DeCLaRe Lab, Nanyang Technological University(DeCLaRe实验室,南洋理工大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对强化学习中统一优势分配导致梯度信号稀释的问题,提出基于梯度激活显著性的令牌级优势重加权方法GRAIL,无需过程级监督即可提升推理对齐,在多个模型上平均准确率提升3.60%。