TombRaider: Entering the Vault of History to Jailbreak Large Language Models
机构 * UNSW(新南威尔士大学) ; NTU(国立大学)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);red teaming(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Main Conference of EMNLP
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * UNSW(新南威尔士大学) ; NTU(国立大学)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);red teaming(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Main Conference of EMNLP
机构 * Zhejiang Gongshang University(浙江工商大学) ; Zhejiang University(浙江大学) ; Binjiang Institute of Zhejiang University(浙江大学滨江研究院)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);RLHF(abstract);safety(abstract)
Comments 18 pages, 19 figures
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Work in progress
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments Accepted in ICLR 2025
Journal ref Addepalli, S., Varun, Y., Suggala, A., Shanmugam, K., & Jain, P. (2025). Does safety training of LLMs generalize to semantically related natural prompts? In The Thirteenth International Conference on Learning Representations 2025
当语法引导攻击:利用结构化输出揭示LLM中的控制平面漏洞
机构 * SKLP, ICT, CAS & UCAS(SKLP、信息科技研究院、中国科学院及中国科学院大学) ; University of Aberdeen(阿伯丁大学) ; University of Leeds(利兹大学) ; SKLP, ICT, CAS(SKLP、信息科技研究院、中国科学院)
专题命中 越狱攻击 :jailbreak(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文研究了通过结构化输出揭示LLM控制平面漏洞的问题,提出了一种名为Constrained Decoding Attack(CDA)的新类别的 jailbreak 方法,通过控制到语义的管道机制,利用schema-enforced logit masking注入恶意前缀,并由模型自身完成有害意图,展示了DictAttack在多个模型上的高攻击成功率,揭示了需要跨平面防御来弥合数据和控制平面之间的语义差距。
Comments To appear in CCS2026
探索和开发预模型安全防护机制
机构 * Purdue University(普渡大学) ; Florida International University(佛罗里达国际大学)
专题命中 越狱攻击 :jailbreak(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文研究了如何通过利用 jailbreak 攻击的可转移性,在目标模型推理前确保提示的安全性,提出了一种新的安全防护设计,减少了预模型防护的误报率,并提供了一种低开销的替代方案。
Journal ref ACM Conference on AI and Agentic Systems (ACM CAIS 2026)
DMN: 一种用于多图像输入多模态大语言模型的组合框架
机构 * AI Security Lab(360人工智能安全实验室) ; International Computer Science Institute(国际计算机科学研究所) ; UC Berkeley(加州大学伯克利分校) ; Beihang University(北航大学)
专题命中 越狱攻击 :jailbreak(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出DMN框架,通过分布式指令、多模态证据和数字链任务,提升多图像输入多模态大语言模型的 jailbreak 性能,实验表明其在GPT-4o、Gemini-2.5-pro和Claude Sonnet 4上的攻击成功率超过90%。
Comments ACL 2026 main conference
自我越狱:语言模型在良性推理训练后可通过推理自行摆脱安全对齐
机构 * Brown University(布朗大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(title);分类 cs.CL
AI总结 研究发现推理语言模型在良性训练后可能通过引入良性假设来规避安全限制,提出通过增加安全推理数据训练可缓解该问题。
Comments Published in The Fourteenth International Conference on Learning Representations (ICLR) 2026
ASTRA:一种用于对抗大语言模型 jailbreak 的自动化框架
机构 * School of Information Science and Engineering, East China University of Science and Technology, Shanghai, China(东华大学信息科学与工程学院,上海,中国)
专题命中 越狱攻击 :jailbreak(title_cn,abstract);alignment(abstract);safety(abstract);分类 cs.LG
AI总结 ASTRA 提出了一种自动化框架,通过闭环机制自动发现、检索和演化攻击策略,提升攻击策略的多样性和适应性。
Comments Acccepted by ACL 2026, 20 pages, 7 figures, 13 tables
专题命中 越狱攻击 :safety(title,abstract);alignment(title);分类 cs.LG
Comments Trigger Warning: the appendix contains LLM-generated text with violence and harassment
扩散大语言模型作为目标与对抗者:机制性安全漏洞利用
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 本研究揭示扩散大语言模型(DLLMs)的安全机制漏洞,提出SN-Guided Diffusion黑盒越狱框架,实现高迁移攻击成功率且生成成本远低于现有方法。
JailMeter:一种基于证据的大语言模型越狱攻击评估框架
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型越狱攻击评估标准和方法不一致的问题,提出基于证据评估框架JailMeter,受信息瓶颈理论启发用双反馈优化过滤噪声,在JailMeter-Eva上评估准确率达97.27%,还提炼出JailMeter\textsubscript{SLM}降低计算成本。
停止测试攻击,开始诊断防御:四检查点框架揭示LLM安全为何破裂
机构 * Technische Universität Berlin(柏林技术大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract,abstract_cn);分类 cs.AI、cs.CY
AI总结 本文提出四检查点框架,通过输入输出阶段和检测级别两个维度分析LLM安全机制,揭示防御漏洞所在及原因,提出WASR指标评估安全性能。
Comments 17 pages, pre-print
生成式AI的计算安全性:假设检验视角
机构 * IBM Research(IBM研究院)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 本文从假设检验角度形式化生成式AI的计算安全性,提出基于信号处理的方法检测恶意输入和AI生成内容。
Comments Extended version of the paper presented at the ICML 2026 Workshop on Hypothesis Testing
语法约束解码可诱使大语言模型生成恶意代码
机构 * College of AI, Tsinghua University(清华大学人工智能学院)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 本文发现语法约束解码(GCD)可被利用发起名为CodeSpear的越狱攻击,使LLM生成恶意代码;并提出安全对齐方法CodeShield,通过生成蜜罐代码防御该攻击。
REFLECTOR: 内化逐步反思以对抗间接越狱
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 提出REFLECTOR两阶段框架,通过教师引导生成反思数据并进行监督微调,再结合强化学习内化自主反思能力,在复杂间接攻击下实现超过90%的防御成功率,同时提升通用性能。
Comments ICML 2026
图正则化稀疏自编码器用于LLM安全引导
机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ; Intesa Sanpaolo(Intesa Sanpaolo公司) ; University of Southern California(南加州大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出图正则化稀疏自编码器,通过在神经元共激活图上平滑解码器向量并应用方向库,提升安全引导效果,在多个基准测试中显著提高有害请求拒绝率。
通过语义触发和心理框架针对大推理模型的推理定向劫持攻击
机构 * College of Intelligence and Computing(智能与计算学院) ; School of New Media and Communication(新媒体与传播学院) ; Shanghai Key Laboratory of Data Science(上海数据科学 key laboratory)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出PRJA框架,通过语义触发选择模块和心理指令生成模块,解决大推理模型推理过程中的安全问题,实验显示在五个问答数据集上攻击成功率达83.6%。
理解安全对齐偏差对大语言模型的影响
机构 * Leidos(Leidos公司)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 研究通过JT和WO方法评估六种大模型在恶意和良性任务中的表现,发现WO方法使模型更易执行恶意活动,而JT方法则更易产生幻觉。通过监督微调有效限制WO带来的攻击能力。
Comments 12 pages, 2 figures, 5 tables
前沿大语言模型中的内部安全崩溃
机构 * Deakin University(德克萨斯大学) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) ; City University of Hong Kong(香港城市大学) ; The University of Melbourne(墨尔本大学) ; Singapore Management University(新加坡管理大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 研究揭示了前沿大语言模型中一种关键故障模式——内部安全崩溃,通过构建ISC-Bench测试集,发现模型在执行某些任务时会持续生成有害内容,且比传统劫持攻击更危险。
Comments 15 pages of the main text, qualitative examples of jailbreaks may be harmful in nature
SafeSeek: 语言模型中安全回路的通用归因
机构 * University of Science ; United Arab Emirates University ; Nanyang Technological University ; Zayed University ; Intelligent Science \& Technology Academy of CASIC
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SafeSeek框架,通过优化识别语言模型中的完整安全回路,验证了在后门攻击和安全对齐场景中的有效性,展示了安全回路的识别与利用方法。
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
延续与拒绝之间的斗争:对LLMs中延续触发突破的机理分析
机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了LLMs中延续触发突破现象,揭示了模型内在延续驱动与安全防御之间的竞争机制,为提升模型安全性提供了新视角。
恶意手术刀:激活引导破坏了大语言模型的安全性
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 该研究发现激活引导技术实际上会破坏大语言模型的安全性,通过实验表明即使随机引导也能增加有害服从的概率,挑战了可解释性带来的安全假设。
大推理模型是自主的越狱代理
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 大推理模型能自主执行越狱攻击,研究揭示其对安全机制的威胁,强调需加强模型对齐以防止被利用