Group Pattern Selection Optimization: Let LRMs Pick the Right Pattern for Reasoning
分组模式选择优化:让大推理模型选择正确的推理模式
机构 * Peking University(北京大学) ; The University of Hong Kong(香港大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 GPSO通过强化学习框架优化大推理模型的推理模式选择,提升其在不同问题上的推理性能。
Comments 8 pages, 5 figures