Agent Benchmarks Fail Public Sector Requirements
代理基准测试未能满足公共部门要求
机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) ; Centre for Digital Governance, Hertie School(数字治理中心) ; Weizenbaum Institute(魏泽瑙研究所) ; Technical University of Munich(慕尼黑技术大学)
AI总结 本文提出公共部门基准测试需满足过程性、现实性、特定性和指标性标准,指出现有基准测试未能全面反映公共部门需求,并呼吁研究人员和公共部门官员共同改进相关评估方法。
Comments Forthcoming @ IASEAI 2026