N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization
N-GRPO:嵌入级邻居混合增强策略优化
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
AI总结 针对大语言模型数学推理中探索策略的折衷问题,提出N-GRPO方法,通过语义邻居混合机制在嵌入层注入多样性,在保持语义一致性的同时提升策略优化效果。
Comments ACL 2026 Findings. 16 pages, 3 figures. Code: https://github.com/ZJUSCL/N-GRPO