WorkBench Revisited: Workplace Agents Two Years On
WorkBench 再探:两年后的工作场所智能体
机构 * Independent researcher(独立研究者)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文重新评估2024至2026年间WorkBench基准上智能体的进展,发现前沿模型在能力和安全性上均有显著提升,但开放权重模型降低了高性能门槛。
Comments 8 pages, 3 figures. Follow-up to arXiv:2405.00823