TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation
TRACE Bench:任务驱动的角色扮演智能体清单评估基准
机构 * Kuaishou GameMind Lab(快手GameMind实验室)
AI总结 研究针对角色扮演评估的黑箱问题,提出TRACE Bench框架,通过清单分解与对话跟踪实现更透明的评估,在覆盖度、鲁棒性等方面优于现有基准,支持闭环演化。
Comments Project page: https://kuaishou-gamemind.github.io/projects/trace_bench/. Code: https://github.com/KuaishouGameMind/TRACE-Bench