Mitigating Forgetting Between Supervised and Reinforcement Learning Yields Stronger Reasoners
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Adobe Research(Adobe研究) ; Rutgers University(罗格斯大学)
专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)