斯坦福大学、康奈尔大学等机构的研究者提出Twin。面对从未见过规则的小游戏,它让AI一边试玩、一边把观察到的状态变化写成可执行代码,为每个游戏建立“数字孪生”,先在内存中验证路线,再提交真正计分的动作。在ARC-AGI-3中,Twin总得分达到93.3%,把基础模型的7.8%大幅推高。
ARC-AGI-3不是静态问答,而是一组没有说明书的交互游戏。智能体要通过观察和操作推断目标、物体含义与状态转移,而且真实动作会消耗预算。只靠语言模型从截图直接猜下一步,容易反复犯同样的错;写出规则却不验证,也会因为一个错误假设把后续规划全部带偏。
每次真实动作都被写进可回放的游戏日志
Twin从少量试探开始,记录动作前后的画面变化,并把状态压缩成网格、对象或颜色等可操作表示。它据此编写一个小型状态转移程序,也就是游戏的“孪生模型”。程序预测点击或移动后的结果,系统再用真实观察逐条回放验证。
Twin从观察、编写孪生模型到验证和执行的完整循环。
预测与现实一致的转移会被保留;出现不一致时,Twin把这个反例加入日志并修复规则。相比一次性总结,持续回放能确保新修改没有破坏已经解释正确的历史步骤。游戏知识由自然语言猜测变成了可以运行、可以被反例推翻的代码。
先在数字孪生里规划,再花真实动作预算
当规则足够稳定后,智能体不必在真实环境中穷举路线。它可以在孪生模型里快速搜索多条候选路径,比较步数、风险和目标状态,只把最有把握的动作提交给计分环境。若模型还无法找到路线,系统会选择信息量更高的探索动作,主动区分多个可能规则。
Twin在内部模型中学习规则并规划动作序列。
这让探索与执行有了明确分工:未计分阶段可以大胆验证假设,计分阶段则使用经过检查的计划。论文报告,Twin在179个可测试关卡上全部通关,并在其中158关比人类更省动作;156关在首次获得奖励之前就已经推断出目标,说明它不是只靠奖励信号反复试错。
“目标墙”还会保存已经确认的终局条件,把不同探索动作得到的线索合并起来。若某条最短路线依赖尚未验证的规则,系统可以先寻找一个低成本反例;确认无误后才进入计分执行。这样既控制动作预算,也减少偶然一次成功被误认为普遍规则。
基础模型7.8%,完整Twin提升到93.3%
同一基础模型直接参与游戏时得分只有7.8%;接入现成智能体框架后达到61.1%;加入可执行孪生、反例修复和内部规划的完整Twin达到93.3%。按游戏计算,它解决25款游戏中的23款,显示改进来自推理工作流,而不是更换了一个专门训练的游戏模型。
Twin在不同配置下的学习过程与得分变化。
ARC-AGI-3仍是结构化二维交互环境,状态和动作比现实软件、机器人或开放世界更容易枚举。实验不能直接说明智能体已经掌握任意游戏,但它提供了一个清晰证据:让模型维护可执行的世界假设,并用每次观察持续校验,比把所有历史塞进提示词更有效。
更有意思的是,Twin的代码不是最终展示品,而是智能体自己的推理介质。规则一旦可以执行,规划器就能进行成百上千次无成本模拟,并精确找到哪条历史转移与新观察冲突,这比自然语言总结更适合长期维护。
Twin在多种游戏规则下检查预测与真实状态是否一致。
下一步把数字孪生带进软件与机器人任务
Twin的思路可以扩展到网页操作、代码调试和机器人规划。智能体先建立局部可执行模型,在沙箱中预测一次点击、一次API调用或一次机械臂动作会改变什么,再选择真正执行的步骤。现实系统虽然更复杂,但“记录—建模—回放—修复”的闭环仍然适用。
未来若能自动决定状态表示的粒度,并处理随机性、连续动作和不完全观察,数字孪生将不再只是解谜技巧,而会成为长时程Agent的工作记忆。它让AI积累的不是一段越来越长的聊天记录,而是一套经得起运行检验、可以继续修改的环境规则。