Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning
超越大语言模型强化学习中的统一令牌级信任区域
机构 * Tencent Hunyuan(腾讯混元)
AI总结 针对PPO风格信任区域在自回归生成中的位置无关问题,提出CPPO方法,通过位置加权阈值和累积前缀预算动态调整令牌级约束,提升训练稳定性和推理准确性。
Comments Project Page: https://hunyuan-cppo.github.io/