arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

腾讯打造首个AAA游戏AI基准:5000小时数据体检47个大模型

作者:arXivDaily编辑部 arXiv 2609.25001 cs · cs.AI · cs.CV

论文导读

近年来多模态大模型在虚拟环境决策中取得飞速进展,但始终缺少针对商业级AAA游戏的标准化评测体系。腾讯ARC实验室联合大湾区大学、香港中文大学和新加坡国立大学等机构推出了首个GameHorizon评测套件,全面接入21款主流大作。研究团队通过标准化环境与5000小时专家轨迹,为大模型提供了多时域且可复现的长程决策体检基准。

核心背景与多时域评测架构

随着生成式AI逐步由单向对话迈向自主具身决策,如何在复杂无序环境中检验大模型的实际行为能力成为行业焦点。为了打破传统游戏基准任务受限的瓶颈,腾讯ARC实验室、大湾区大学、香港中文大学与新加坡国立大学的研究团队联合构建了首个通用游戏评测系统GameHorizon。以往基准依赖局部静态截图,模型只要猜中单步动作就能拿高分,完全无法反映其对复杂时空因果与长线规则的真实掌握水平。

针对这一痛点,研究人员将游戏决策划分为微观按键操作、中时域技能衔接以及宏观长程规划三个递进时域。评测平台全面支持键鼠与手柄等原生接口,能实时记录多模态环境反馈,彻底消除了不同游戏引擎之间的底层交互隔阂。

图:统一评估框架涵盖环境输入捕获模型因果推理与实时动作执行反馈

真实大作数据与专家轨迹标注

为了给模型提供真正具备挑战性的参考标杆,研究团队组织了100位人类高水平玩家进行系统性操作数据采集。数据集最终收录了超过5000小时的高清多模态录像,涵盖动作冒险、角色扮演、射击对抗和沙盒创造等21款具有代表性的商业大作。采集流程完整保留了同步的第一人称视角视频、玩家眼动关注区域、毫秒级键鼠操作轨迹以及伴随的关键阶段游戏内存状态。

在此基础上,研究团队构建了包含百万量级的高质量因果链条标注,对玩家的关键意图转换与突发事件应对进行了精细切片。无论是面对复杂地貌的障碍跨越,还是在资源匮乏条件下的装备合成与战术周旋,数据集都提供了明确的子目标划分与逻辑归因。

图:离线评测覆盖21款游戏超5000小时的多模态专家实战操作时序数据

关键突破与多维模型体检

在统一基准下,研究人员对涵盖开源与商业闭源在内的47个主流大模型展开了系统性体检评估,总调用测试次数突破百万大关。实验结果揭示了现有模型在游戏智能层面的显著分化:在单步指令和局部视觉目标识别上,领先的视觉语言模型表现抢眼,准确率普遍接近人类玩家。然而一旦任务延伸至需要超过十步的中长程因果逻辑,例如在开阔地图中搜集原料制作复合道具,绝大多数模型的成功率便呈现断崖式下跌。

图:47个模型在短程指令识别与长程多阶段战术规划测试中的综合得分走势

未来应用与落地展望

作为连接基础大模型与复杂虚拟世界的开放平台,GameHorizon的推出为通用智能体走向自主闭环奠定了坚实的基石。在实际产业应用中,这一评估套件能够直接服务于下一代高智能非玩家角色研发,使虚拟伴侣和游戏对手展现出更为鲜活逼真的人格化反应。同时,工业级游戏开发也可以利用高水平智能体进行自动化自动化测试与数值平衡校验,显著降低大型项目的研发调试周期。

参考资料

https://arxiv.org/abs/2609.25001

https://gamehorizon-suite.github.io

https://github.com/TencentARC/GameHorizon