论文导读
中科院信息工程研究所、中关村实验室、小米汽车、阿里巴巴达摩院提出GameReplica:不给智能体源码、说明书或现成轨迹,只允许它看截图并操作目标游戏,再写出可运行复刻。基准含125项任务、25款受控游戏和5类核心机制。
从照着需求写代码,变成先猜需求
常见代码智能体评测会提供问题描述、仓库上下文、设计稿或演示轨迹。模型要解决的是“怎样实现已经说清楚的功能”。黑盒程序没有这些提示,规则藏在按钮响应、状态变化和输赢条件里,智能体必须自己探索后再实现。
GameReplica只开放截图和动作接口。智能体点击、输入或重置游戏,观察像素变化,归纳对象、碰撞、计分和终止规则,然后生成一个独立可运行版本。外部程序再分别检查规则一致性、实现一致性和视觉保真度。
图:论文对比程序合成、视觉转代码、游戏智能体与GameReplica的输入和目标差异。
25款游戏拆成125级难度
基准覆盖25款为验证设计的游戏,每款设置5个难度级别,共125项任务。五类机制让测试不只看某一种小游戏:智能体需要识别视觉元素,也要通过主动交互判断潜在状态转移。隔离环境限制源码、内部状态和网络访问,避免模型绕过黑盒观察。
流程分为探索和复刻。探索阶段有固定观察预算,智能体决定下一次点击或按键;实现阶段生成网页游戏并自检。验证器使用隐藏规则与可执行测试,不只比较最终截图,因此“画得像”但按钮逻辑错误也会被单独计为失败。
图:智能体先通过截图和动作主动探测规则,再生成隔离运行的游戏副本并接受外部验证。
最强模型71.6%,其余最高只有42.9%
实验中表现最好的Claude Opus 4.8总体得分71.6%,其余模型落在4.0%至42.9%。论文还报告实现分层:Claude Opus 4.8实现分67.4,GPT-5.5为39.4,其余四个模型低于25。这里评的是特定运行框架下的受控任务,不代表对商业游戏的通用复刻能力。
所有模型都出现同一倾向:视觉保真度明显高于实现一致性和规则一致性。模型能根据截图重建颜色、布局和图标,却可能漏掉只有操作后才出现的机制。难度从L1升到L5后,较弱模型分数下降更快,说明主动探索和规则归纳会放大底座差距。
图:125个复刻实例按忠实、视觉不匹配、规则违规和无法识别等结果类别拆分。
下一步让代码智能体先学会“发现问题”
这套基准的价值不在复刻游戏本身,而在把软件任务前移一步:真实工作经常没有完整需求,智能体要先通过界面、日志和反馈建立规格。下一步可以扩展更长状态链、更多交互控件和跨页面程序,同时继续保持外部验证,区分“看起来像”和“真的按同样规则运行”。
参考资料
https://arxiv.org/abs/2609.22308