DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows
DuMateBench:评估自主智能体在复杂真实工作流程中的表现
机构 * Renmin University of China(中国人民大学) ; Shandong University(山东大学) ; Michigan State University(密歇根州立大学) ; Nankai University(南开大学) ; East China Normal University(华东师范大学) ; Imperial College London(伦敦帝国学院) ; Baidu, Inc.(百度公司)
AI总结 DuMateBench是基于真实用户会话构建的自主智能体评估基准,含200个跨8场景的任务,注入三类环境复杂性,搭配五款智能体框架与四款LLM实验,发现严格任务完成存在显著差距。