Establishing Best Practices for Building Rigorous Agentic Benchmarks
机构 * UIUC(伊利诺伊大学) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; Yale University(耶鲁大学) ; Princeton University(普林斯顿大学) ; MIT(麻省理工学院) ; Transluce ; ML Commons ; Amazon(亚马逊) ; UK AI Safety Institute(英国人工智能安全研究所) ; University of Oxford(牛津大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI
Comments 39 pages, 15 tables, 6 figures