Certified Multi-Turn Robustness for LLM Safety via Compositional Bounds and Safety Persistence
通过组合边界与安全持久性实现大语言模型安全的多轮认证鲁棒性
机构 * Peking University(北京大学) ; Renmin University of China(中国人民大学) ; Tsinghua University(清华大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tencent Hunyuan(腾讯混元)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI
AI总结 针对LLMs易受多轮越狱攻击的问题,提出MTCR框架,通过状态对抗MDPs等方法实现多轮认证鲁棒性,实验表明其经验安全性能超认证边界。