Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);red teaming(abstract)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);red teaming(abstract)
当图文推理遇上安全:什么决定了多模态越狱鲁棒性?
机构 * Independent Researcher(独立研究者) ; Stanford University(斯坦福大学) ; Harvard University(哈佛大学) ; Purdue University(普渡大学) ; Duke University(杜克大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究多模态大语言模型中不同图文推理范式对越狱鲁棒性的影响,发现显式图像工具交互能显著降低攻击成功率,并通过引入图像工具安全向量框架从表征层面解释其机制。
Comments 17 pages, 6 figures, 7 tables
单个神经元足以绕过大型语言模型的安全对齐
机构 * Apple(苹果公司) ; University of Maryland, College Park(马里兰大学 College Park 分校)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过针对单个神经元展示安全对齐的两种失效方向,证明在不训练或提示工程的情况下,通过抑制或放大特定神经元可绕过安全对齐。
LASA:语言无关的语义对齐在语义瓶颈处用于LLM安全性
机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学对话人工智能(CoAI)组,DCST,清华大学) ; Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出LASA方法,通过在语义瓶颈层对齐安全理解,提升LLM在所有语言中的安全性,实验显示攻击成功率显著降低。
HarmChip:通过禁用基准测试评估以硬件安全为中心的LLM安全
专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract)
AI总结 本文提出HarmChip基准测试,评估LLM在硬件安全领域的禁用脆弱性,涵盖16个领域、120种威胁和360个提示,揭示了先进LLM在安全查询与伪装攻击间的矛盾表现。
良性微调破坏音频大语言模型的安全对齐
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(abstract,abstract_cn)
AI总结 研究探讨了音频大语言模型中良性微调对安全对齐的影响,发现通过嵌入空间距离筛选良性音频可降低安全风险,但不同架构和模态的微调风险存在差异,提出两种防御措施以降低安全漏洞。
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICML 2025
专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 14 pages
专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract)
SEMA: 简单却有效的多轮对抗攻击学习
专题命中 越狱攻击 :jailbreak(title,abstract);DPO(abstract,abstract_cn);alignment(abstract);safety(abstract)
AI总结 SEMA通过多阶段学习实现高效多轮对抗攻击,无需依赖现有策略,提升攻击成功率并增强安全测试能力。
Comments ICLR 2026, 37 pages, 13 tables, 7 figures
改进方法而非提示:针对大语言模型的进化式 jailbreak 攻击合成
机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) ; School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)
专题命中 越狱攻击 :jailbreak(title,title_cn);red teaming(abstract);分类 cs.CL
AI总结 本文提出 EvoSynth 框架,通过在代码空间中进行搜索,而非仅在提示空间中优化,从而提高对大语言模型的 jailbreak 攻击成功率和多样性。
MT-JailBench: 一个多模块的多轮 jailbreak 攻击评估基准
机构 * International Computer Science Institute(国际计算机科学研究所) ; Berkeley Lab(伯克利实验室)
专题命中 越狱攻击 :jailbreak(title,title_cn);分类 cs.AI
AI总结 本文提出 MT-JailBench,一个用于评估多轮 jailbreak 攻击的模块化框架,揭示了资源预算和评估函数对攻击效果的影响,发现提示生成是性能变化的主要因素,而动态策略生成并非必要。
揭示LLM安全对齐中的logit抑制漏洞
机构 * Huazhong University of Science and Technology(华中科技大学) ; Nanyang Technological University(南洋理工大学) ; University of New South Wales(新南威尔士大学) ; Nankai University(南开大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出SSAG方法,通过系统操控输出层logit揭示LLM安全对齐的漏洞,实验显示其在五种主流模型上以95%成功率暴露有害响应,同时减少86%的响应时间。
Kill-Chain Canaries: 阶段级跟踪跨攻击表面和模型安全层级的提示注入
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Chicago(芝加哥大学)
专题命中 越狱攻击 :safety(title,abstract);prompt injection(title,abstract);分类 cs.AI、cs.LG
AI总结 研究通过跟踪加密令牌四个阶段,揭示提示注入是管道-架构问题,发现写节点位置是最高安全决策,所有防御因通道不匹配失效,且隐形白字体PDF负载可匹配或超越可见文本ASR。
Comments 10 pages, 8 figures. Benchmark code and run logs released
TriPlay-RL:三角色自我对抗强化学习用于大语言模型安全对齐
机构 * Peking University(北京大学) ; Qiyuan Tech(启元科技) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 TriPlay-RL通过三角色自我对抗强化学习,实现LLM安全对齐的高效且可扩展范式,提升攻击有效性、安全性能和评估准确性。
LLM-VA: 通过向量对齐解决对抗性回应与过度拒绝的权衡
机构 * Zhejiang University(浙江大学) ; Griffith University(格里菲斯大学) ; Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(title);safety(abstract);分类 cs.AI、cs.LG
AI总结 LLM-VA通过向量对齐解决大型语言模型在对抗性回应与过度拒绝间的权衡问题,提升安全性和效用。
遗忘的安全性:通过持续学习保持大型语言模型的安全对齐
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本文通过持续学习方法有效缓解大型语言模型在适应新任务时的安全退化问题,证明了持续学习在保持模型安全性和任务实用性方面的有效性。
差异化方向干预:一种规避LLM安全对齐的框架
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出DBDI框架,通过区分有害检测和拒绝执行方向,提升LLM安全对齐的规避效果。
Comments AAAI-26-AIA
机构 * Department of Mathematics National University of Singapore(数学系新加坡国立大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
Comments Published as a conference paper at COLM 2025
机构 * Mindgard ; Lancaster University(兰卡斯特大学)
专题命中 越狱攻击 :jailbreak(title,abstract);prompt injection(title,abstract);分类 cs.AI、cs.LG
Comments 14 pages, 5 figures, 11 tables. To be published in LLMSec 2025
机构 * Huazhong University of Science and Technology(华中科技大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Nanyang Technological University(南洋理工大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);分类 cs.CL、cs.AI
Comments To appear in ACL 2024
用于人工智能安全评估的对抗性提示框架
机构 * Microsoft(微软)
专题命中 越狱攻击 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI
AI总结 针对人工智能尤其是生成式人工智能应用增加带来的安全问题,提出对抗性提示框架,通过生成多复杂程度的对抗性提示评估模型弹性,在企业环境中实现自动化测试并获定量指标及差异结果。
Comments 3 pages, 1 figure, presented as a poster at International Conference on Data Science (CODS), December 17-20, 2025, Pune, India
协同LoRA:大语言模型安全对齐中的组合性漏洞
机构 * Mercedes-Benz Research & Development North America, USA(梅赛德斯-奔驰北美研发中心)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.LG
AI总结 研究发现模块化大语言模型的安全对齐存在组合性漏洞,通过Colluding LoRA展示有害行为仅在组合状态下出现,暴露了当前单元中心防御的组合盲点。
Comments Updated manuscript to better reflect the core contribution
深度安全攻击:从深度安全注意力头中劫持大语言模型
专题命中 越狱攻击 :jailbreak(title,abstract);safety(title);alignment(abstract);分类 cs.AI
AI总结 本文提出SAHA攻击框架,通过深入分析注意力头的漏洞,提升对抗样本生成的鲁棒性,实验显示其在ASR指标上优于现有方法。
多流扰动攻击:通过并发任务干扰破坏思考LLM的安全对齐
专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(abstract);分类 cs.AI
AI总结 多流扰动攻击通过并发任务干扰破坏思考LLM的安全对齐,实现高攻击成功率和推理过程崩溃
对LLMs对抗提示注入和 jailbreak攻击的分析
机构 * Bishop Cotton Boys’ School(伯希特·康普顿男校)
专题命中 越狱攻击 :jailbreak(title,abstract);prompt injection(title);safety(abstract);分类 cs.AI
AI总结 本文研究了LLMs对提示注入和jailbreak攻击的脆弱性,通过实验分析不同模型的行为差异,并评估了轻量级防御机制的效果。
Comments 12 pages, 5 figures, 6 tables
AISA: 在大型语言模型中唤醒对抗劫持攻击的内在安全性意识
机构 * Beijing University of Technology(北京理工大学) ; Macau University of Science and Technology(澳门科技大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);分类 cs.AI
AI总结 AISA通过激活模型内在安全机制,提供一种轻量级、单次通过的防御方法,有效提升大型语言模型对抗劫持攻击的鲁棒性与安全性。
对抗攻击-防御共演进用于LLM安全对齐的树组双感知搜索与优化
机构 * Fudan University(复旦大学) ; Alibaba Group(阿里巴巴集团) ; Yale University(耶鲁大学) ; IBM Research AI(IBM人工智能研究) ; Indiana University(印第安纳大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(abstract);分类 cs.AI
AI总结 ACE-Safety通过树组双感知搜索与优化,共同优化攻击与防御模型,提升LLM的安全对齐能力。
机构 * Ant Group(蚂蚁集团) ; Nanyang Technological University(南洋理工大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
Comments Accepted by IEEE Symposium on Security and Privacy (S&P) 2026