Improving Data and Reward Design for Scientific Reasoning in Large Language Models
改进大型语言模型中的数据与奖励设计以提升科学推理能力
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);post-training(abstract);SFT(abstract)
AI总结 本文提出Dr. SCI数据集和后训练流程,通过探索扩展SFT、动态难度课程和SciRubric引导RL提升大型语言模型的科学推理能力。