SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
SPARK:基于过程的奖励机制用于无参考强化学习
机构 * Amazon AGI(亚马逊人工智能实验室) ; UCLA(大学)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)
AI总结 SPARK提出一种无参考强化学习框架,通过生成和验证模型提升过程奖励模型性能,在数学推理任务中取得优于真实参考的方法的成果。