浙江大学和苹果提出PaperGym,把每篇论文转成一套研究计划训练环境,并发布2万条实例。按同一训练方案得到的Qwen3-8B在ResearchQA上达到73.48,高于论文所列的更大模型Kimi K2.6;这一比较只对应单项评测,不代表综合科研能力全面领先。
研究计划没有像数学题那样唯一的标准答案,强化学习因而难以获得稳定奖励。PaperGym从论文的方法与实验中提取逐条评分规则,让模型提出方案后能被具体评价,同时避免直接从问题文本中抄出答案。
把问题和评分依据放在论文两端
既有数据常从同一段内容生成研究问题和评分标准,模型只要换一种说法复述提示,就可能得到高分。这种“标准泄漏”会让训练看似有效,实际没有要求模型提出方法、实验和验证逻辑。
PaperGym利用论文结构拆开两端:研究目标与背景用于合成问题,方法与实验用于形成评分规则。规则覆盖方法创新与实验设计,再经过生成、合并、排序和过滤。论文报告标准泄漏率降至3.7%,而对比数据为11.90%至34.10%。
图:论文Figure 1页面区域,展示论文解析、评分规则生成以及两阶段训练。
同一套评分表先教答案,再充当奖励
训练分成两个阶段。第一阶段OPSD把评分规则作为教师可见的特权上下文,帮助模型学习一份合格研究计划应覆盖哪些要点;第二阶段GRPO不再直接展示规则,而是把逐条满足情况转成奖励,促使模型自行组织方案。
顺序很关键。先由规则指导自教师,再把规则用于强化学习,优于只做监督微调、只做其中一个阶段以及反向排列。对Qwen3-1.7B、4B和8B,五项基准平均分别提高5.6、5.0和4.8分,说明收益没有局限在单一模型尺寸。
图:论文Figure 3页面区域,展示数据规模效应及OPSD、GRPO不同顺序的训练动态。
2万条训练数据胜率达到58.1%
在训练配方保持不变时,使用PaperGym-20k训练的模型在三方比较中赢得58.1%,RubricHub Science为28.2%。这项对照把数据质量与训练算法尽量分开:差异来自问题和评分规则如何构造,而不是为某个数据集另调一套流程。
训练后的Qwen3-8B在ResearchQA上得到73.48,超过论文表格中的Kimi K2.6。这个数字证明小模型可通过专门训练改善研究问答,但ResearchQA仍只是研究能力的一个切面;能回答论文问题,不等于能独立提出正确、可复现且有价值的新研究。
图:论文Table 2页面区域,比较PaperGym-20k、RubricHub与基础模型的逐项胜率。
AI科学家走向可检查的过程奖励
PaperGym的意义在于把模糊的“计划好不好”拆成方法创新、实验设计等可逐项核验的标准。对研究助手来说,这种反馈可用于补实验对照、检查评价指标或发现方案与目标不匹配,而不只是生成更长的文字。
团队公开了构建流程、PaperGym-20k、PaperGym-Innov和PaperGym-Design。后续应检验评分规则本身的偏差,以及跨学科论文能否稳定解析。更重要的是,要用真实研究执行结果验证:规则高分的计划是否更可行,而不是只在另一个模型担任评委时表现更好。
评分规则还可能继承原论文的盲点。一篇论文采用的实验设计未必覆盖后来发现的重要变量,自动提取系统若把它当成唯一标准,会奖励对既有方案的模仿。更稳妥的做法是保留规则来源,让人类评审看到每一项来自方法、实验还是作者论述,并允许增加反例、资源约束与伦理检查。
模型规模比较也要保持边界。Qwen3-8B在ResearchQA的73.48说明训练配方对这项任务有效,但科研计划还涉及文献新颖性、实验资源、数据合规和结果复现。后续可以让模型在固定预算下真正执行小型实验,再比较计划评分与实际完成率的相关性。
如果执行反馈能够回流,PaperGym的训练环境就不再只依赖论文事后总结,而能连接“提出计划—运行实验—修正规则”的闭环。届时,逐条评分表的价值将体现在减少无效实验,而不只是提高文本评测分数。
参考资料
https://arxiv.org/abs/2608.31119
https://zju-real.github.io/PaperGym