Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents
安全性无法组合:自主大型语言模型智能体的非衰减循环状态
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Nanyang Technological University(南洋理工大学) ; Supply Chain Tech Team Y, JD.com(京东Y供应链技术团队) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Fullive-AI(Fullive人工智能)
专题命中 红队测试 :safety(title,abstract);分类 cs.AI
AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。