Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents
安全性无法组合:自主大型语言模型智能体的非衰减循环状态
专题命中 红队测试 :safety(title,abstract);分类 cs.AI
AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
安全性无法组合:自主大型语言模型智能体的非衰减循环状态
专题命中 红队测试 :safety(title,abstract);分类 cs.AI
AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。