Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Pengcheng Laboratory(鹏城实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Journal ref NeurIPS 2025