M-GRPO: Stabilizing Self-Supervised Reinforcement Learning for Large Language Models with Momentum-Anchored Policy Optimization
M-GRPO:通过动量锚定策略优化稳定大语言模型的自监督强化学习
机构 * Shanghai Innovation Institute(上海创新研究院) ; College of Future Information Technology, Fudan(复旦大学未来信息技术学院) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 M-GRPO通过动量锚定策略优化和IQR过滤方法,稳定大语言模型的自监督强化学习训练,提升训练稳定性和性能。
Comments 7 pages, 5 figures,Accepted NeurIPS 2025 Workshop on Efficient Reasoning