Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
下一块推理强化学习(RL)真的比监督微调(SFT)更好?——在无思维链(CoT)数据下重新审视训练策略
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室)
AI总结 本研究对比下一块推理RL与混合SFT,发现混合SFT在更少计算量下性能上限更高,且需在完整后训练 pipeline 中评估无CoT训练策略。