Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization
推理的动量:策略优化中的密集内在信号
机构 * Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学) ; Eastern Institute of Technology(东方理工学院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对GRPO在长链推理中因二元奖励导致的零优势崩溃和幻觉确定性失败模式,提出ISPO方法,通过内在信号密集化奖励,在三个基模型和五个数学推理基准上持续优于基线。
Comments 14 pages, 6 figures, 8 tables