arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

快手开源TRACE Bench:测角色扮演AI不再只给总分,99.91%设定逐条核验

arXiv 2608.11236 cs.AI · cs.CL

一个模型扮演游戏角色得82分,究竟是忘了世界观、说错人物关系,还是没有完成玩家交代的目标?快手GameMind Lab开源TRACE Bench,把角色设定提前拆成固定检查表,再用用户Agent对话并保存逐轮证据。它在更少对话轮次中覆盖99.91%的关键角色点,并评测了26个模型。

过去常让两个模型自由聊天,再由裁判给一个整体分数。问题是对话可能从未触及角色档案中的许多要求,高分只说明已聊到的内容表现不错,无法证明模型守住了全部设定。

角色档案先拆成一张固定检查表

TRACE Bench在对话开始前离线解析角色与场景,将“保持身份”“记住人物关系”“遵守世界知识”“完成目标”“兑现承诺”等要求写成固定条目。所有参评模型面对同一张表,避免用户Agent临时改变评分标准。

TRACE Bench用角色检查表追踪对话证据

TRACE Bench用角色检查表追踪对话证据。

对话过程中,用户Agent看不到最终分数,却会根据模型回答私下更新条目状态。每一项可以是完成、进行中、待检查、失败或放弃,并绑定最近一轮证据。最后的82分可以追溯到41项完成、9项失败,而不是裁判模型的一句总体印象。

用户Agent根据未覆盖条目主动追问

自由聊天经常在少数热门话题上打转。TRACE的用户Agent读取当前检查状态,选择尚未触发的要求自然发问。它不会直接说“现在测试第4条”,而是通过任务、冲突或角色关系把目标嵌入剧情,让模型暴露是否真正记住设定。

检查项在多轮对话中的状态转换机制

检查项在多轮对话中的状态转换机制。

团队用同一张角色检查表回查MiniMax Role-play Benchmark公开的M2自由对话记录,关键角色点覆盖率为73.74%;TRACE Bench在更少轮次中达到99.91%。99.91%指测试触达了多少设定,并非被测模型答对99.91%。

覆盖率和正确率分开后,榜单更容易解释。某个模型若未被问到关键关系,即使回答自然也不能据此加分;如果检查项已经触发,系统会保存对应回答,评审人员可以复核状态判断。测试过程因此同时提供广度和证据。

重复运行和更换用户Agent后排名仍保持稳定

论文对26个模型给出总榜及细分能力,并做重复运行、替换用户Agent等鲁棒性测试。排名在这些变化下保持稳定,说明得分没有严重依赖某个固定提问模型或一次随机对话。检查表轨迹还能区分同分模型:一个可能善于维持口吻,另一个更擅长完成任务。

用户Agent在剧情中触发设定并记录证据

用户Agent在剧情中触发设定并记录证据。

TRACE还提出闭环基准演化。评测中若发现某种提问能稳定暴露失败,系统可把验证方法沉淀到后续版本,用于更有针对性地检查同类角色要求。更新的是如何触发与核验,固定检查项仍为跨模型比较提供共同尺度。

TRACE Bench论文中的模型比较与实验分析

TRACE Bench论文中的模型比较与实验分析。

从排行榜走向游戏角色上线前验收

游戏和陪伴应用需要的不只是“聊起来像”,还要确保角色不泄露设定外信息、不忘主线关系,并在长对话中遵守任务边界。TRACE的条目—轮次—证据链可以直接转成上线验收报告,编辑和安全团队能定位具体失败文本。

后续可以加入更长剧情、多人角色和实时游戏状态,让检查项覆盖工具调用与行为结果。开源代码和项目页面已经提供复现实验的入口。对实际产品而言,可追溯评测比单个总分更适合决定某个角色是否达到发布标准。

制作团队还可以把角色编剧文档直接映射为检查项:哪些是必须遵守的硬设定,哪些允许模型自由发挥,哪些触发后需要安全回复。上线后收集到的新型错误可回填为验证方法,形成角色更新、评测和修复的闭环。

当角色设定修改时,固定检查表也能做版本管理。团队可以对比新旧模型在同一批未变条目上的表现,再单独查看新增剧情要求,避免总分变化掩盖具体能力回退。对多语言角色,还可保留同一逻辑检查项,只替换对话实现,检验翻译后是否仍守住人物关系和世界知识。

参考资料

https://arxiv.org/abs/2608.11236

https://kuaishou-gamemind.github.io/projects/trace_bench/

https://github.com/KuaishouGameMind/TRACE-Bench