arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Baidu(百度)

2026-07-16 至 2026-07-16 共收录 1
2607.11506 2026-07-16 cs.LG cs.CL 版本更新

SCOPE-RL: Optimizing Reasoning Paths Before and After Success

SCOPE-RL:成功前后优化推理路径

Xiaojian Liu, Han Xu, Jianqiang Xia, Zhixuan Li, Ke Xu, Yiwei Dai, Xinran Chen, Changwo Wu, Yuchen Li

机构 * Baidu Inc.(百度公司) Shandong University(山东大学)

AI总结 研究针对可验证奖励强化学习中推理路径反馈不足问题,提出SCOPE-RL框架,分两阶段优化,成功前添加奖励,成功后细化轨迹,并经评估协议验证,相比仅结果的GRPO提升准确率、减少推理令牌,且与其他方法互补。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏