The Echo Chamber Multi-Turn LLM Jailbreak
回声室多轮LLM劫持
机构 * NeuralTrust ; ICREA and UPF(ICREA和UPF)
专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI
AI总结 Echo Chamber是一种利用逐步升级方法的多轮攻击,旨在绕过聊天机器人的安全防护,通过精心设计的交互链对LLM进行劫持。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
回声室多轮LLM劫持
机构 * NeuralTrust ; ICREA and UPF(ICREA和UPF)
专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI
AI总结 Echo Chamber是一种利用逐步升级方法的多轮攻击,旨在绕过聊天机器人的安全防护,通过精心设计的交互链对LLM进行劫持。
通过强化学习的迭代工具伪装攻击对大型语言模型进行劫持
机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(信息科学与技术学院,北京理工大学) ; School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) ; School of Computer Science, University of Auckland(计算机科学学院,奥克兰大学) ; QAX Security Center, Qi-AnXin Technology Group Inc.(QAX安全中心,启安新科技集团) ; Qi-AnXin Technology Group Inc.(启安新科技集团) ; Zhongguancun Laboratory(中关村实验室)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出iMIST方法,通过伪装工具调用和强化学习优化,提高对大型语言模型的攻击效果,揭示现有安全机制的漏洞。
基于知识的多轮对抗攻击大语言模型
机构 * Southeast University(东南大学) ; Nanyang Technological University(南洋理工大学) ; OPPO Research Institute(OPPO研究院)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG
AI总结 Mastermind通过动态知识库和分层规划架构,实现对大语言模型的高效多轮对抗攻击,显著提升攻击效果和防御韧性。
多轮劫持攻击在多模态大语言模型中的应用
机构 * Knight Foundation School of Computing and Information Science, Florida International University(骑士基金会计算与信息科学学院,佛罗里达国际大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI总结 本文提出多轮劫持攻击及FragGuard防御机制,评估其在多模态大语言模型中的有效性。