arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Agent不再靠文字笔记猜规则,Schema把ARC-AGI-3得分从58.7%拉到99.2%

作者:arXivDaily编辑部 arXiv 2609.39140 cs · cs.AI

论文导读

Impossible Research、加州大学伯克利分校与卡内基梅隆大学提出Schema,让Agent把未知环境规律写成可执行程序,再用历史转移逐步验证和修正。论文在ARC-AGI-3的RHAE指标上把同一基础模型从58.7%提高到99.2%,并在DiG-bench解开全部公开游戏;结果依赖给定工具与测试预算。

文字笔记很难直接回答下一步会发生什么

探索未知游戏时,Agent常把观察写成自然语言经验,例如“蓝块可能会旋转”。这种笔记含糊、彼此冲突,也难用于搜索。Schema要求模型把规则编码成程序:输入当前状态与动作,程序必须产出下一状态。任何历史转移都可立即做回测,猜错就得到具体反例,而不是继续堆叠口头解释。

图:Agent先写环境程序,用历史回测认证,再在程序中规划,并以新观测继续修正规则。

可执行规则把探索变成有目的的实验

系统先从屏幕提取对象与状态,提出候选机制;随后用工具运行程序,要求重现已经记录的全部转移。通过认证后,规划器才在内部模型中搜索动作。若真实观察与预测不符,执行立即停止,将差异作为反例送回规则修订。这样,探索动作既服务完成任务,也服务区分多个可能机制。

图:方法示意与柱状结果并列,右侧游戏画廊展示规则需要跨越的多种界面和机制。

99.2%来自持续验证,不是一次猜中

论文在ARC-AGI-3上报告RHAE由Claude Code基线的58.7%提升到99.2%;DiG-bench公开游戏的胜率由基础框架52.4%提高到90.5%,并解开全部公开游戏。提升并不意味着第一次生成的程序正确,关键在于回测工具能暴露反例,Agent会循环修订。私有关卡、视觉噪声和更大的状态空间仍会增加搜索压力。

图:案例展示规则程序怎样驱动迷宫规划,旁边的游戏集合说明评测并非单一关卡。

下一步是迁移到更难回滚的真实软件

程序化世界模型适合规则清晰、状态可观察的游戏。进入网页、桌面软件或机器人后,状态可能缺失,动作还可能不可逆。落地需要为程序加入不确定性、权限边界与人工确认,并让验证工具识别“尚未证明”而非强行给出确定规则。若这些约束成立,Schema式Agent可从经验笔记升级为可审计的操作模型。

面向真实软件,可以先把Schema程序限制在沙箱里,只允许预测下一状态和提出候选动作,不能直接操作生产数据。系统应保存每次假设、反例和程序版本,并要求关键规则通过最小测试集后才进入规划。环境更新后,旧程序必须重新认证,防止Agent沿用过期界面或权限逻辑。评估也要增加错误模型的危害:一个在大多数历史上正确、却在删除或付款动作上预测错误的程序,不能因为总体回放分数高就被批准执行。

参考资料

https://arxiv.org/abs/2609.39140

https://impossible.org/

↑