一个模型扮演游戏角色得82分,究竟是忘了世界观、说错人物关系,还是没有完成玩家交代的目标?快手GameMind Lab开源TRACE Bench,把角色设定提前拆成固定检查表,再用用户Agent对话并保存逐轮证据。它在更少对话轮次中覆盖99.91%的关键角色点,并评测了26个模型。
过去常让两个模型自由聊天,再由裁判给一个整体分数。问题是对话可能从未触及角色档案中的许多要求,高分只说明已聊到的内容表现不错,无法证明模型守住了全部设定。
角色档案先拆成一张固定检查表
TRACE Bench在对话开始前离线解析角色与场景,将“保持身份”“记住人物关系”“遵守世界知识”“完成目标”“兑现承诺”等要求写成固定条目。所有参评模型面对同一张表,避免用户Agent临时改变评分标准。
TRACE Bench用角色检查表追踪对话证据。
对话过程中,用户Agent看不到最终分数,却会根据模型回答私下更新条目状态。每一项可以是完成、进行中、待检查、失败或放弃,并绑定最近一轮证据。最后的82分可以追溯到41项完成、9项失败,而不是裁判模型的一句总体印象。
用户Agent根据未覆盖条目主动追问
自由聊天经常在少数热门话题上打转。TRACE的用户Agent读取当前检查状态,选择尚未触发的要求自然发问。它不会直接说“现在测试第4条”,而是通过任务、冲突或角色关系把目标嵌入剧情,让模型暴露是否真正记住设定。
检查项在多轮对话中的状态转换机制。
团队用同一张角色检查表回查MiniMax Role-play Benchmark公开的M2自由对话记录,关键角色点覆盖率为73.74%;TRACE Bench在更少轮次中达到99.91%。99.91%指测试触达了多少设定,并非被测模型答对99.91%。
覆盖率和正确率分开后,榜单更容易解释。某个模型若未被问到关键关系,即使回答自然也不能据此加分;如果检查项已经触发,系统会保存对应回答,评审人员可以复核状态判断。测试过程因此同时提供广度和证据。
重复运行和更换用户Agent后排名仍保持稳定
论文对26个模型给出总榜及细分能力,并做重复运行、替换用户Agent等鲁棒性测试。排名在这些变化下保持稳定,说明得分没有严重依赖某个固定提问模型或一次随机对话。检查表轨迹还能区分同分模型:一个可能善于维持口吻,另一个更擅长完成任务。
用户Agent在剧情中触发设定并记录证据。
TRACE还提出闭环基准演化。评测中若发现某种提问能稳定暴露失败,系统可把验证方法沉淀到后续版本,用于更有针对性地检查同类角色要求。更新的是如何触发与核验,固定检查项仍为跨模型比较提供共同尺度。
TRACE Bench论文中的模型比较与实验分析。
从排行榜走向游戏角色上线前验收
游戏和陪伴应用需要的不只是“聊起来像”,还要确保角色不泄露设定外信息、不忘主线关系,并在长对话中遵守任务边界。TRACE的条目—轮次—证据链可以直接转成上线验收报告,编辑和安全团队能定位具体失败文本。
后续可以加入更长剧情、多人角色和实时游戏状态,让检查项覆盖工具调用与行为结果。开源代码和项目页面已经提供复现实验的入口。对实际产品而言,可追溯评测比单个总分更适合决定某个角色是否达到发布标准。
制作团队还可以把角色编剧文档直接映射为检查项:哪些是必须遵守的硬设定,哪些允许模型自由发挥,哪些触发后需要安全回复。上线后收集到的新型错误可回填为验证方法,形成角色更新、评测和修复的闭环。
当角色设定修改时,固定检查表也能做版本管理。团队可以对比新旧模型在同一批未变条目上的表现,再单独查看新增剧情要求,避免总分变化掩盖具体能力回退。对多语言角色,还可保留同一逻辑检查项,只替换对话实现,检验翻译后是否仍守住人物关系和世界知识。
参考资料
https://arxiv.org/abs/2608.11236