arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Kuaishou(快手)

2026-08-13 至 2026-08-13 共收录 2
2608.11236 2026-08-13 cs.CL cs.AI 新提交

TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation

TRACE Bench:任务驱动的角色扮演智能体清单评估基准

Jiahui Zhang, Ziwei Zhang, Yipeng Wang, Yibo Liu, Haozhou Pang, Yikai Hu, Hongyan Ren, Lan Zhou, Qi Gan, Kai Sheng

机构 * Kuaishou GameMind Lab(快手GameMind实验室)

AI总结 研究针对角色扮演评估的黑箱问题,提出TRACE Bench框架,通过清单分解与对话跟踪实现更透明的评估,在覆盖度、鲁棒性等方面优于现有基准,支持闭环演化。

Comments Project page: https://kuaishou-gamemind.github.io/projects/trace_bench/. Code: https://github.com/KuaishouGameMind/TRACE-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10444 2026-08-13 cs.CL cs.AI 版本更新

From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models

从推理深度到推理广度:评估大型语言模型中的多点关联推理

Si'an Xie, Jiaxun Liu, Biao Yang, Wei Yuan, Fan Yang, Tingting Gao, Ming Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Kuaishou Technology(快手科技)

AI总结 该研究构建了中英双语多点关联推理基准MPAR-Bench,发现大型语言模型的推理深度未自动带来稳健的推理广度,当前基准未充分覆盖推理广度。

详情

展开后加载摘要…

URL PDF HTML 收藏