How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks
多少任务足以做出智能体基准决策?对公共大语言模型智能体基准的重放分析
AI总结 研究智能体基准测试中多少任务足以做决策,通过重放公共任务级记录,提出部分预算需满足支持完整基准决策、覆盖任务组及控制未解决比较比例等条件,还指出部分评估报告应包含的内容。
Comments KDD 2026 Workshop Agentic AI Evaluation and Trustworthiness