面对一款规则完全陌生的网格益智游戏,大多数智能体的做法是"看一帧、走一步":靠反应式试错摸索规律,每走错一步都要在计分里留下代价。ARC-AGI-3把这类游戏做成了正式基准——64×64的彩色网格、没有文字说明、每一步操作都计入得分。德累斯顿工业大学与亚马逊的研究者,联合莱布尼茨科学与技术信息中心(TIB)提出Tycho:一个"边玩边写世界模型"的编码智能体。它不直接预测下一步动作,而是把观察到的游戏规则写成可执行代码,先在自己的模型里推演计划,再到真实游戏里落子。
在ARC-AGI-3全部25个公开游戏、183个关卡上,Tycho搭配GPT-5.6 Sol与Opus 5两款前沿模型,均取得相对人类动作效率RHAE满分100.00,所有游戏全部通关;其中表现最好的配置,比官方人类基准合计少用61%的计分动作。
不猜下一步,先把游戏"重写"一遍
Tycho把一局游戏看作一台确定性机器:画面是内部状态的渲染结果,动作触发状态转移,抵达特定状态则关卡结束。智能体内部分工明确:行动者负责与真实环境交互,构建者负责把游戏规则写成Python程序——状态变量、初始化方式、转移规则、把状态渲染回网格的函数、胜负判定,都由代码自由定义。编排者在多个抽象层级上拿主意:什么时候该请构建者建模,什么时候直接行动,验证失败后又该何时修复模型。这个模型不是黑箱里的隐式预测,而是一份可以逐行阅读、编辑、跨关卡复用的可执行假设。
每条状态转移,都要和真实画面对账
模型写得对不对,不靠感觉。Tycho会把模型渲染出的画面与历史观测逐帧比对,动画帧、过关帧、失败帧与可行动帧被严格区分;只有被评级的状态转移严格匹配,模型才算通过验证。论文把这套审计称为世界模型诊断:构建者被调用了多少次、建模带来多少效率增益、有多少关的状态转移被精确复现,都被放在一起衡量。
图1:世界模型诊断把模型预测与真实状态转移逐条核对,精确匹配的关卡越多,模型越可信。
在游戏cd82进入第4关前,模型已对前3关累计的38个评级状态转移全部严格复现,新关卡的初始画面也渲染得分毫不差。论文也给出反例:另一款游戏里模型机制完全正确,却始终没搞懂目标是什么,长长的行动计划屡屡落空——状态转移对得上,并不等于游戏能赢得了。
先在模型里推演,再到现实里落子
通过验证的模型直接变成一台"模拟器":搜索算法可以在里面穷举动作序列,找出通往目标的最短路线,而不必在真实游戏里花步数试错。cd82第4关,模型在内部模拟出一条13步行动计划,行动者采纳第一条建议后照单执行,整条序列一次性完整走通,首次尝试即过关。
图2:规划案例中,模型在画布上模拟整条13步上色序列,每一步都与真实观测严格一致,行动者照单执行后首次尝试即过关。
当现实与模型冲突时,验证机制还能定位错误并就地修复。一次此前从未见过的碰撞让模型预测落空,构建者补写新规则后,模型对累计168个评级状态转移全部精确复现,随即重新规划出一条12步续关路线,行动者沿路线一次走通。
没见过的机制,用一次操作做检验
新关卡常引入新机制。游戏ka59后期出现会周期性伸缩的活塞,模型沿用"活塞都朝下伸出"的旧假设,搜遍全部6888个可达状态也找不到解。智能体没有乱试,而是把最短计划的第一步设计成判别性实验:一个动作之后,天花板活塞顶部与地面活塞底部如期露出橙色,新假设"活塞朝远离支撑面的方向伸出"得到证实;第12步再完成关键的运输验证。剩余计划无需修正,最终45步填满全部插槽,而对照基线用了132步。
图3:适应新关卡时,智能体把普通操作变成假设检验,45步完成关卡,对照基线需要132步。
满分之后:边界与下一步
这项满分成绩需要客观看待。论文明确交代:每种配置都只在25个公开游戏上运行了一次,其中5个游戏还参与了开发调优;结果刻画的是固定公开测试集上的表现,既不能证明对完全未见游戏的泛化,也不反映多次运行的稳定性。此外,成绩来自前沿模型与整套工具链的耦合系统,很难把模型自带的先验知识与现场习得分开。
即便如此,Tycho指的方向很清晰:让智能体把经验沉淀成可检查、可执行、可反驳的模型,而不是把智能全压在逐帧反应上。实现代码已以Apache-2.0协议开源,后续还计划让执行器批量执行已验证动作、在预测不符时立即中断,进一步压缩推理开销。当"游戏规则"可以被写出来、被对账、被修复,学会一款新游戏才开始从碰运气变成工程问题。