Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability
超越SFT:通过强化学习构建更安全且推理能力更强的大推理模型
机构 * Michigan State University(密歇根州立大学) ; IBM Research(IBM研究院)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 本文提出通过强化学习提升大推理模型的安全性和推理能力,克服了传统监督微调的不足。