论文导读
Quome、华盛顿大学等机构提出“世界时间计算”:把领域规则写成可执行程序,自动生成带精确答案的训练轨迹。0.5B模型在60个训练世界学习后,对20个未见世界的诊断准确率提高29个百分点;收益主要出现在符号状态和短步推理,像素任务、长链任务及已饱和的大模型不在同一结论范围内。
真实标注太少,就先把规则写成能运行的世界
许多专业领域缺的不是问题描述,而是大量带正确答案的过程数据。论文的办法是把状态变化规则写成代码:输入当前状态和一个动作,程序精确给出下一状态。一个模板可以实例化成许多规则不同的世界,每个世界又能持续产生状态、动作和答案都已知的轨迹。
这些程序不是让语言模型每一步猜结果。代码必须先通过接口、运行和不变量检查,必要时再接受另一个模型对规则的批评。被接受的世界在长序列中按确定规则执行,不会像逐步神经预测那样把小误差越滚越大。论文把在许多世界轨迹上继续训练称为“世界时间计算”,对应测试阶段让模型多想几步的计算投入。
图1:代码动力学保持长轨迹精确,并为小模型提供跨世界训练收益。
生成、训练、检查形成一条可追溯闭环
OpenWorld框架负责把规则模板变成可运行世界,并统一暴露观察、行动和验证接口。训练系统从不同世界采样轨迹,让模型预测下一状态或诊断隐藏规则;验证器随时可以用程序答案检查输出。若某个世界的代码错误,它会制造稳定却错误的标签,因此“能运行”之外,还必须验证规则与声明一致。
图2:世界生成器、代码验证、轨迹训练和错误检查组成闭环。
损坏标签对照说明了这一点。只增加任务变化却让答案不再精确,模型并没有获得同样收益。论文还让代码世界接受十倍分布外探测,验证过的动力学保持100%精确;逐步语言模型和MLP预测器则会在滚动过程中累积错误。
小模型加29点,大模型收益逐步饱和
在60个训练世界产生的轨迹上微调后,模型要诊断20个从未见过的世界。0.5B模型准确率提高29个百分点,模型规模增大后提升缩小,32B模型约为3个百分点且落在噪声范围内。能力较弱的模型缺少可迁移经验,因而从程序生成数据中得到更多补偿;本来就接近任务上限的模型没有同样空间。
另一项List Functions实验采用更严格的跨世界设置:一个适配器在128个互不重叠的世界训练,对留出世界达到40%准确率,损坏标签对照只有6%,相差34个百分点。
图3:128个训练世界迁移到留出世界时,精确标签训练为40%,损坏标签对照为6%。
收益并非普遍定律。论文明确指出,它更适合几步就能完成的符号推理;链条变长、任务依赖视觉感知,或模型已经饱和时,增益会减弱。不同任务若没有共享技能,跨任务迁移也很有限。
先在规则清楚的业务里落地,再扩展到混合环境
库存流转、排程、软件状态机和可形式化的诊断流程,都可能用代码世界制造训练经验。实际部署应保留程序版本、验证测试和轨迹来源,防止错误规则批量污染模型。下一步可以把程序世界与真实数据结合:代码提供精确骨架,真实样本校正程序没有覆盖的噪声。像素原生环境仍需感知模型,代码世界更适合作为可检查的规划和训练层。
参考资料
https://arxiv.org/abs/2609.09163