CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks
CoopGuard:基于协作代理的有状态多轮防御框架用于抵御LLM的演变攻击
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) ; Big Data Institute, Central South University(中南大学大数据研究院)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出CoopGuard,通过协作代理维护和更新内部防御状态,有效应对多轮演变攻击。实验显示其在攻击成功率、欺骗率和攻击效率上均优于现有方法。