Mind the Gap: Evaluating Model- and Agentic-Level Vulnerabilities in LLMs with Action Graphs
注意差距:通过动作图评估LLM在模型和代理层面的漏洞
机构 * Holistic AI ; University College London(伦敦大学学院)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.CL
AI总结 本文通过动作图评估LLM在模型和代理层面的漏洞,揭示了代理层面特有的风险,并展示了通过动作图改进提示能有效降低代理 jailbreak 成功率。
Comments ICLR 2026 Agents in the Wild (Spotlight & Oral); ICLR 2026 AFAA; OpenAI Red-Teaming Challenge Winner (2025); NeurIPS 2025 LLMEval