Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning
专题命中 越狱攻击 :jailbreak(title,abstract)
Comments 6 pages
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :jailbreak(title,abstract)
Comments 6 pages
专题命中 越狱攻击 :jailbreak(title,abstract)
Journal ref The Network and Distributed System Security Symposium (NDSS) 2024
专题命中 越狱攻击 :safety(title,abstract)
PsychJail:通过对大语言模型策略的多轮说服探索心理越狱
机构 * The Defense Innovation Institute, Academy of Military Sciences(军事科学院国防创新研究院)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.AI
AI总结 本文提出PsychJail框架,利用社会心理学技术构建攻击策略,通过轨迹级强化学习优化,在四个对齐LLM上实现87.3%平均攻击成功率,揭示了不同模型的心理画像指纹,为LLM安全红队提供了新方向。
用于忠实表示干预的概念集中化
机构 * SAIC Centre, USYD(SAIC中心)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 研究大语言模型表示干预中定位忠实概念的问题,提出概念集中化(COCA)方法,通过重构训练数据简化决策边界,有效降低分布内和分布外越狱成功率,且在常规任务上保持性能。
Comments ICML'26; Hongzheng and Yongqiang contributed equally; project page: https://causalcoat.github.io/coca
当基准谎言:在真实分布偏移下评估恶意提示分类器
机构 * Zenity
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.LG
AI总结 研究通过LODO评估揭示了现有方法在真实分布偏移下的局限性,并展示了SAE特征在提升分类器解释性方面的潜力。
Comments v2: extended version of the AIWILD @ ICLR 2026 workshop paper; adds multi-model replication and additional analyses
木马提示:通过伪造助手消息来破解对话式多模态模型
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 研究针对对话式多模态模型的安全漏洞,提出木马提示越狱技术,通过伪造对话历史绕过安全机制,在谷歌Gemini-2.0上实验显示其攻击成功率高于现有方法,揭示对话AI安全缺陷,呼吁转变验证范式。
Comments We stopped working on this idea because we realized that there was a paper submitted before it that took almost identical approach
CAP-CoT:用于提升大语言模型推理中思维链的循环对抗提示
机构 * Department of Electronic Engineering, Kyung Hee University(韩国庆熙大学电子工程系) ; School of Computer Science and Engineering, University of Electronic Science and Technology of China(中国电子科技大学计算机科学与工程学院) ; Henan Polytechnic University(河南理工大学) ; School of Computing, Kyung Hee University(韩国庆熙大学计算机学院)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.AI
AI总结 CAP-CoT通过循环对抗提示框架提升LLM推理的准确性和稳定性,通过生成候选推理链、构造有缺陷的链并对比反馈,优化推理过程。
坏公司败坏好道德:理解与衡量叙事引发的LLM道德推理退化
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CY
AI总结 本研究提出BreakingBad框架,系统衡量负面叙事沉浸对LLM道德推理、行为及部署风险的影响,发现叙事暴露导致道德准确率下降12%-31%,且退化具有结构性,第一人称叙事影响更强,并传播至实际部署场景。
MetaBreak: 通过特殊标记操纵越狱在线LLM服务
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 提出利用特殊标记构造攻击原语,绕过LLM安全对齐和内容审核,并发现防御困难,实验显示MetaBreak在内容审核下优于现有方法。
Comments Accepted version. Revised to match the version accepted to the 2026 IEEE Symposium on Security and Privacy (SP); added publication information and DOI
Journal ref Proceedings of the 2026 IEEE Symposium on Security and Privacy (SP), pp. 98-117, IEEE Computer Society, 2026
从盾牌到靶心:针对基于LLM的智能体护栏的拒绝服务攻击
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.AI
AI总结 本文揭示基于LLM的护栏易受拒绝服务攻击,通过束搜索优化框架和机制感知结构变异生成恶意负载,导致令牌放大13-63倍、延迟放大148倍,威胁系统可用性。
GAS-Leak-LLM:基于遗传算法的后缀优化实现黑盒LLM越狱
机构 * Department of Electrical, Computer and Biomedical Engineering(电气、计算机与生物医学工程系) ; University of Pavia(帕维亚大学) ; Department of Computer Applications(计算机应用系) ; Cochin University of Science and Technology(科钦科学技术大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 提出GAS-Leak-LLM方法,利用遗传算法在黑盒设置下自动进化对抗后缀以绕过LLM安全约束,验证了现有安全机制的不足。
潜在空间攻击用于语言模型的拒绝规避
机构 * University of Cagliari(卡利亚里大学) ; University of Genova(热那亚大学)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.AI
AI总结 本文研究了如何通过潜在空间攻击来规避语言模型的拒绝行为,提出了一种受控的潜在空间攻击方法,以提高攻击成功率,优于现有方法。
通过对比对偶搜索进行定向神经元调节
机构 * Nous Research(Nous研究)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);alignment(abstract);分类 cs.LG
AI总结 研究通过对比神经元属性识别有害与良性提示的区分神经元,实现无梯度的神经元干预,有效降低拒绝率并保持输出流畅性,展示了神经层面干预在行为引导中的优势。
超越后缀:在大语言模型对抗攻击中的标记位置
机构 * University of Cagliari(卡利里大学) ; Sapienza University of Rome(罗马大学) ; Huawei Technologies Finland Research Center(芬兰华为技术研究中心)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 研究探讨了在大语言模型对抗攻击中,标记位置对攻击成功率的影响,指出在Greedy Coordinate Gradient攻击中,优化攻击生成前缀而非后缀以及调整对抗标记位置对攻击效果有显著影响。
Comments 12 pages, 10 figures, presented at the "I Can't Believe It's Not Better" workshop at ICLR 2026
ASGuard:激活-缩放防护:缓解针对性劫持攻击
机构 * Korea University(韩国大学) ; AIGEN Sciences(AIGEN公司)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文提出ASGuard框架,通过电路分析识别与针对性劫持相关的注意力头,训练通道缩放向量重新校准激活,结合预防性微调提升模型拒绝能力,有效降低攻击成功率并保持模型性能。
Comments ICLR 2026, 29 pages, 11 figures
矩阵劫持:用于受控模型反制的空域操控
机构 * Department of Computer & Information Science & Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系) ; School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院) ; Computer Science Laboratory, SRI International(SRI国际计算机科学实验室)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出HMNS方法,通过识别并抑制注意力头,注入受限于正交补集的扰动,实现对模型的受控反制,展示了新的安全防御范式。
消除守护栏:通过动态上下文表示消解进行推理时的劫持
机构 * Zhejiang University(浙江大学) ; Binjiang Institute of Zhejiang University(浙江大学滨江研究院)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出CRA框架,通过动态抑制模型守护栏来提升推理时的劫持防御能力,实验显示其在多个开源LLM上表现优异,揭示了当前对齐机制的脆弱性。
基于LLM-as-a-Judge和混合模型的提示攻击检测
机构 * GovTech, Singapore(新加坡政府科技局)
专题命中 越狱攻击 :safety(abstract);red teaming(abstract);prompt injection(abstract);分类 cs.CL
AI总结 本文探讨轻量级通用LLM在真实生产环境中作为安全判断者的可靠性,通过结构化推理过程检测提示攻击,实验表明Gemini-2.0-Flash-Lite-001等模型可有效用于实时防护,同时评估混合模型对攻击检测的提升效果。
Comments 16 pages, 3 figures
TreeTeaming:通过分层策略探索实现视觉语言模型的自主红队测试
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.LG
AI总结 TreeTeaming通过动态演化策略探索方法,实现对视觉语言模型的自主红队测试,显著提升攻击成功率和策略多样性,同时降低攻击毒性。
Comments CVPR2026
进化式越狱:针对大语言模型的自动化多目标长尾攻击
机构 * School of Artificial Intelligence(人工智能学院) ; Brain-Inspired Technology Co.,Ltd(脑启发技术有限公司) ; Department of Computer Science and Engineering(计算机科学与工程系) ; Southern University of Science and Technology(南方科技大学) ; Nanyang Technological University(南洋理工大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出EvoJail框架,通过多目标进化搜索自动发现长尾分布攻击,提升对大语言模型安全性的评估。
SIA:一种用于知识引导和安全的电子商务搜索LLM的合成-注入-对齐框架
机构 * Beijing China(中国北京)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 本文提出SIA框架,通过合成高质量语料库、参数高效预训练和双路径对齐方法,解决电子商务搜索LLM的知识幻觉和安全漏洞问题,并在京东实现工业部署。
级联:组合软件硬件攻击工具以在复合AI系统中实现对抗性威胁放大
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文提出通过结合传统软件硬件漏洞与LLM算法攻击,实现复合AI系统中的对抗性威胁放大,展示两种新型攻击方法并系统化分析其组合。
Comments 11 pages, 8 figures, 1 table
BitBypass:一种新的方向:利用位流伪装进行对齐大语言模型的黑盒劫持
机构 * SPIES Research Lab, Dept. of CSE, Texas A&M University(SPIES研究实验室,计算机科学与工程系,德克萨斯A&M大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 BitBypass通过位流伪装技术,提出了一种新的黑盒劫持方法,有效绕过对齐大语言模型的安全机制,展现出更高的隐蔽性和攻击成功率。
Comments 27 pages, 27 figures, and 4 tables
ShallowJail: 对大语言模型的对抗性攻击
机构 * xxx
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 ShallowJail通过操纵LLMs的初始标记来攻击其对齐机制,从而降低大语言模型的安全性。
多模态推理的红队测试:通过跨模态纠缠攻击劫持视觉-语言模型
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; People’s Public Security University of China(中国人民公安大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出CrossTALK方法,通过跨模态纠缠攻击提升对视觉-语言模型的劫持效果,实现高攻击成功率。
通过Bootstrap聚合实现高效且适应性强的恶意LLM提示检测
机构 * KAUST(卡塔尔人工智能研究所在线中心)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.LG
AI总结 BAGEL通过Bootstrap聚合和专家混合方法,实现高效且适应性强的恶意LLM提示检测,以高F1得分超越现有大参数模型。
文本就是视觉-语言模型劫持所需
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 Text-DJ通过将文本转换为图像并诱导干扰,成功绕过视觉-语言模型的安全防护,揭示了OCR能力在面对分散多模态输入时的脆弱性。
通过多模态推理实现对视觉语言模型的逃逸攻击
机构 * Novi High School, MI, USA(诺维高中) ; Michigan State University, MI, USA(密歇根州立大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出了一种基于多模态推理的逃逸攻击框架,通过训练后链式推理和自适应噪声机制提高对视觉语言模型的安全过滤器的绕过能力。
基于表情符号的大型语言模型劫持
机构 * Vishnu Institute of Technology(维什努技术学院)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本研究通过测试基于表情符号的提示揭示了大型语言模型在安全对齐方面的漏洞,发现不同模型对表情符号攻击的响应存在显著差异,强调了在提示层面加强安全机制的重要性。
Comments 7 pages, 2 figures