arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-06 至 2026-08-06 共收录 182 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 28 篇

2601.23112 2026-08-06 cs.CY 版本更新 50%

How Should AI Safety Benchmarks Benchmark Safety?

AI安全基准应该如何进行基准测试?

Cheng Yu, Severin Engelmann, Ruoxuan Cao, Dalia Ali, Orestis Papakyriakopoulos

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出改进AI安全基准的方法,通过系统回顾210个基准,指出其技术、知识论和社会技术缺陷,并提出稳健度量和风险管理原则以提升基准有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2608.04033 2026-08-06 cs.CR 新提交 50%

SoK: How Frontier AI Reshapes System-Level Security Risk Dynamics in Critical Infrastructure

SoK:前沿人工智能如何重塑关键基础设施中的系统级安全风险动态

Chandra Thapa, Mohan Baruwal Chhetri, Marthie Grobler, Shahroz Tariq, Tooba Aamir

专题命中 其他Agent :agentic(abstract)

AI总结 本研究提出五维风险动态框架,分析前沿人工智能重塑关键基础设施系统级安全风险的机制,指出学术研究与运营约束的错配,推动系统级安全保证研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏