固定训练题库会被智能体逐渐做熟,继续强化学习只是在重复已经会的任务。华盛顿大学、斯坦福大学、卡内基梅隆大学、麻省理工学院等机构提出SPADE,让同一个模型同时扮演“环境设计者”和“推理智能体”,生成可执行环境并随学习进度调整难度。
扩展到30B参数后,SPADE在八项留出的数学、科学、代码和推理测试上相对最强固定环境基线平均提升5.3分;多轮工具调用BFCL-v4提升5.7分,ACEBench-Agent提升13.9分。论文明确标注为进行中的工作,结果尚待独立复现。
出题人直接编写带奖励的可执行环境
环境设计者输出完整Python代码,提供类似OpenAI Gym的reset和step接口,内部包含状态转移、奖励与验证逻辑。生成代码先通过语法、执行和可解性检查,再进入训练池,而不是只生成一道自然语言题。
每个环境还附带一个特权提示。推理智能体分别在有提示和无提示条件下试玩,两者奖励差被当作“遗憾”:提示能显著改善结果,说明题目位于当前能力边缘;完全做不会或无需提示就做对的环境,训练价值较低。
项目图:从训练第0步到第384步,环境逐渐从简单观察转向需要状态交互的多轮任务。
两个角色共享一套模型并用不同奖励更新
推理智能体用任务回报学习如何行动,环境设计者用提示带来的遗憾学习如何出题。两个角色共享策略,通过GRPO更新。环境设计者还读取预训练语料中的文档和累计环境记忆,扩大题型来源并避免反复生成相同任务。
项目框架图:环境设计者生成代码和提示,推理智能体进行有提示与无提示试玩,两种奖励更新共享策略。
提示只用来测量题目难度,无提示轨迹才训练推理智能体,减少直接把答案泄露给答题角色。生成环境仍可能含验证漏洞或与现实工具脱节,自动可执行不等于任务本身有价值。
自适应题库训练到400步仍在改善
固定人工题库、静态合成题库和冻结验证器都会保持目标分布不变。SPADE的完整版本在400步内继续提高,而固定环境基线较早饱和。项目分析显示,完整版本长期保留约三分之一胜率在20%到80%之间的“可学任务”;去掉关键组件后,这类任务供应迅速下降。
项目主结果:30B模型在科学、代码与程序推理等留出测试上比较SPADE和固定环境训练,竞赛数学能力保持。
这些留出测试没有直接出现在生成游戏中,作者据此认为增益来自程序性技能迁移。不过环境设计者依赖预训练语料,题目与评测之间仍可能存在概念重叠,不能写成完全无关领域的零样本学习。
更强但冻结的出题模型仍会被学习者追上
消融把环境设计者冻结、去掉语料 grounding、移除记忆,或改用更强的冻结前沿模型GPT-5.5出题。所有冻结或不完整版本都较早见顶;更强的冻结出题者只恢复不到完整SPADE一半增益,说明题库跟着学习者变化比初始出题模型更强更重要。
项目消融图:冻结、无记忆和无语料等变体较早饱和,自适应环境设计者在后期继续提供训练信号。
同一模型兼任出题与答题也可能形成双方共同利用的漏洞。部署前需要外部验证器、人工抽查和跨模型评测,确认提升来自可迁移推理,而非共享策略形成的暗号。
下一步是接入真实工具与独立审计
SPADE可用于持续生成代码调试、数据处理和多步工具任务,让课程难度随着代理能力更新。下一阶段应让环境调用受控浏览器、数据库或机器人模拟器,并记录生成任务的安全边界和资源消耗。
研究还需比较不同随机种子、外部出题模型和完全隔离的评测集,验证400步后的增益是否稳定。当前结果给出一种开放式训练机制,但“持续自我改进”仍是实验框架中的趋势,不是已经无限扩展的能力。