Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation
Agent-Diff:通过代码执行基于状态差的评估来基准测试LLM代理在企业API任务上的表现
机构 * Minerva University(Minerva大学)
AI总结 本文提出Agent-Diff框架,通过代码执行和基于状态差的评估,评估LLM代理在企业API任务中的性能,提供了九个LLM在224个任务上的基准测试,并通过消融实验评估框架的鲁棒性。
Comments Pre-Print. Under review for KDD 2026