CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning
CE-GPPO:通过梯度保持剪裁策略优化协调熵在强化学习中
机构 * Kuaishou Technology(快手科技) ; Independent(独立)
AI总结 本文提出CE-GPPO算法,通过恢复剪裁令牌的梯度信号,协调探索与利用,缓解熵不稳定问题,并在数学推理任务中优于现有方法。
Comments This paper has been accepted by ACL 2026