The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning
过程奖励模型的隐藏偏见:PRISM用于奖励正确推理
机构 * University of Maryland(马里兰大学) ; Amazon(亚马逊) ; University of Central Florida(中佛罗里达大学)
AI总结 针对过程奖励模型因训练数据不平衡导致的虚假高评分偏见,提出PRISM框架,通过对比步骤级比较和前瞻策略生成的难负样本,结合难度感知课程学习优化,显著降低假阳性率并提升推理准确性。