When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents
当拒绝失效时:长上下文LLM代理中的不稳定安全机制
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现长上下文LLM代理在性能和拒绝率上存在不稳定安全问题,揭示了评估长多步骤任务代理安全性的挑战。
Comments 12 pages, 11 figures. Accepted at AAAI 2026 TrustAgent Workshop