How Should AI Safety Benchmarks Benchmark Safety?
AI安全基准应该如何进行基准测试?
专题命中 Agent评测 :workflow(abstract)
AI总结 本文提出改进AI安全基准的方法,通过系统回顾210个基准,指出其技术、知识论和社会技术缺陷,并提出稳健度量和风险管理原则以提升基准有效性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
AI安全基准应该如何进行基准测试?
专题命中 Agent评测 :workflow(abstract)
AI总结 本文提出改进AI安全基准的方法,通过系统回顾210个基准,指出其技术、知识论和社会技术缺陷,并提出稳健度量和风险管理原则以提升基准有效性。
SoK:前沿人工智能如何重塑关键基础设施中的系统级安全风险动态
专题命中 其他Agent :agentic(abstract)
AI总结 本研究提出五维风险动态框架,分析前沿人工智能重塑关键基础设施系统级安全风险的机制,指出学术研究与运营约束的错配,推动系统级安全保证研究。
Comments 19 pages