Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Models
扩展与剪枝:为生成模型中的有效GRPO最大化轨迹多样性
机构 * MAIS & NLPR, Institute of Automation, CAS(自动化研究所信息与智能系统研究所与神经语言处理研究所) ; School of Artificial Intelligence, UCAS(人工智能学院)
AI总结 本文提出Pro-GRPO框架,通过扩展与剪枝策略在生成模型中提升GRPO效果,减少计算开销并提高轨迹多样性。
Comments 10 pages, 5 figures