Learning to Explore with Parameter-Space Noise: A Deep Dive into Parameter-Space Noise for Reinforcement Learning with Verifiable Rewards
通过参数空间噪声学习探索:深入研究可验证奖励的强化学习
机构 * Shanghai Innovation Institute, Shanghai, China(上海创新研究院) ; College of Future Information Technology, Fudan University, Shanghai, China(未来信息科技学院,复旦大学) ; Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室) ; The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 通过参数空间噪声提升探索能力,PSN-GRPO在多个基准中提升推理能力并超越传统探索方法。
Comments 17 pages, 10 Figures