Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
基于知识的多轮对抗攻击大语言模型
机构 * Southeast University(东南大学) ; Nanyang Technological University(南洋理工大学) ; OPPO Research Institute(OPPO研究院)
AI总结 Mastermind通过动态知识库和分层规划架构,实现对大语言模型的高效多轮对抗攻击,显著提升攻击效果和防御韧性。