Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
理解用于大语言模型推理的进化策略:比GRPO更广泛的推理覆盖范围
机构 * Southern University of Science and Technology(南方科技大学) ; National University of Singapore(新加坡国立大学) ; Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室) ; City University of Hong Kong(香港城市大学)
AI总结 本文研究用于LLM推理的进化策略(ES),发现ES比GRPO有更广泛的推理覆盖范围,开发了结合两者优势的GRPO-ES策略,还揭示了ES的功能稀疏性等特性,确立其为独特的推理后训练范式。