Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
理解用于大语言模型推理的进化策略:比GRPO更广泛的推理覆盖范围
Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang
机构
*
Southern University of Science and Technology(南方科技大学)
;
National University of Singapore(新加坡国立大学)
;
Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海))
;
Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
;
City University of Hong Kong(香港城市大学)