Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety
认知防火墙:一种主动、零信任、多门控的LLM安全框架
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract)
AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
认知防火墙:一种主动、零信任、多门控的LLM安全框架
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract)
AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。
HarmRLVR: 利用可验证奖励进行有害大模型对齐
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract)
AI总结 提出HarmRLVR,首次系统研究可验证奖励强化学习(RLVR)的对齐可逆性风险,通过仅64个有害提示的GRPO即可快速逆转安全对齐,攻击成功率高达96.01%。
追踪拒绝的动态:利用潜在拒绝轨迹进行鲁棒越狱检测
机构 * Peking University(北京大学) ; Nanyang Technological University(南洋理工大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过因果追踪识别出稀疏的“拒绝轨迹”激活模式,并提出轻量级白盒检测器SALO,基于隐藏状态窗口实现鲁棒越狱检测。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). Camera-ready version
椭球控制:通过良性潜在建模的白名单越狱防御
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
AI总结 提出一种基于白名单视角的测试时防御方法Ellipsoid Control,通过拟合良性数据的各向异性椭球约束投影梯度下降,在任意输入上触发拒绝同时最小化良性潜在几何的扭曲,从而在增强安全性的同时保持模型效用。
Comments Under review by TIFS
从AI生成内容到代理行为:生成式AI中的安全与安全威胁
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract)
AI总结 研究探讨生成式AI从内容生成转向执行操作带来的安全与安全威胁,分析攻击者需求、系统自主性及潜在危害的变化,并评估检测、水印、对齐等技术对策,指出当前治理机制无法提供必要的协调。
Comments Accepted by Journal of Information and Intelligence (JII)
通过渐进分辨率处理和自适应特征对齐对多模态大语言模型进行对抗攻击
机构 * Sun Yat-sen University(中山大学) ; Nanyang Technological University(南洋理工大学) ; Shenzhen MSU-BIT University(深圳MSU-BIT大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract)
AI总结 本文提出PRAF-Attack框架,通过多尺度语义指导和中间层局部对齐提升多模态大语言模型的对抗攻击转移性,实验表明其在多种黑盒MLLM上表现更优。
STARE:分步时间对齐与红队引擎用于多模态毒性攻击
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract)
AI总结 STARE通过分步时间对齐和红队引擎,提升多模态毒性攻击的成功率,揭示优化诱导的相位对齐现象,为安全机制提供理论基础。
Comments ICML 2026
推理劫持:大语言模型中推理对齐的脆弱性
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract)
AI总结 本文指出现有安全研究忽视了推理对齐的脆弱性,提出新的对抗性提示攻击方法'推理劫持',通过注入虚假决策标准影响模型推理逻辑,实验表明即使先进模型也易受此类攻击影响。
Comments accepted by ACL 2026
在像素之间阅读:将文本-图像嵌入对齐与字体攻击成功性联系起来
机构 * Cisco Systems(思科系统)
专题命中 越狱攻击 :alignment(title);safety(abstract);prompt injection(abstract)
AI总结 研究了视觉-语言模型中字体提示注入攻击的影响,发现字体大小、文本攻击有效性及嵌入距离对攻击成功率有显著影响,为防御策略提供实证指导。
Comments Accepted at ICLR 2026 Workshop on Agents in the Wild
AttackEval: 一种针对大语言模型的提示注入攻击有效性系统性实证研究
专题命中 越狱攻击 :prompt injection(title,abstract);safety(abstract)
AI总结 AttackEval系统性研究提示注入攻击有效性,揭示了Obfuscation攻击在对抗意图感知防御时的成功率最高,以及复合攻击策略显著提升攻击成功率,为改进大语言模型安全系统提供指导。
面向推理的编程:通过链式语义工具来突破大型视觉语言模型
专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract)
AI总结 本文提出面向推理的编程方法,通过链式语义工具突破大型视觉语言模型的安全对齐。
JailBound: 视觉语言模型内部安全边界的劫持
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Xuan Tong(宣通) ; NSFOCUS
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract)
AI总结 JailBound通过在视觉语言模型的潜在空间中探索安全边界,提出了一种新的劫持框架,有效提升了白盒和黑盒攻击成功率,揭示了模型的安全风险。
Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)
针对提示注入和劫持攻击的LLM防御措施系统文献综述:扩展NIST分类
专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文系统回顾了针对提示注入和劫持攻击的LLM防御措施,扩展了NIST分类,并提供了全面的防御目录和指南。
Comments 27 pages, 14 figures, 11 tables, submitted to Elsevier Computer Science Review
葡萄酒中的真理与漏洞:通过醉酒语言诱导检验LLM安全性
机构 * School of Computer Science and Engineering, UNSW Sydney(计算机科学与工程学院,新南威尔士大学悉尼分校) ; School of Computing and Information System, the University of Melbourne(计算与信息系统学院,墨尔本大学)
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过诱导LLM产生醉酒语言,研究其安全漏洞,发现其易受劫持攻击和隐私泄露,揭示了LLM安全性的潜在风险。
Comments WIP
从静态到适应性:基于免疫记忆的大型语言模型 jailbreak 检测
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
AI总结 基于免疫记忆的框架,通过动态记忆更新和主动免疫机制,提升大型语言模型对 jailbreak 攻击的检测准确率至 94%。
SafePTR: 通过剪枝-恢复机制实现多模态大语言模型的令牌级 Jailbreak 防御
机构 * Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳研究院) ; Southwestern University of Finance and Economics(西南财经大学) ; Engineering Research Center of Intelligent Finance, Ministry of Education(教育部智能金融工程研究中心) ; Tongji University(同济大学)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
AI总结 SafePTR 提出一种无需训练的多模态大语言模型防御机制,通过剪枝有害令牌并恢复良性特征,有效提升安全性并保持效率。
Comments Accepted by NeurIPS 2025
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted By NeurIPS 2025
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
Comments Under Review
机构 * Berkeley(伯克利) ; Mila – Quebec AI Institute(魁北克人工智能研究所) ; Montreal, Quebec, Canada(魁北克省蒙特利尔市) ; McGill University(麦吉尔大学) ; Georgia Tech(佐治亚理工学院)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.CY
机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) ; School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) ; School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息系统学院)
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 23 pages, 10 figures
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) ; Shanghai Qi Zhi Institute(上海启智研究所) ; University of Chicago(芝加哥大学)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract)
Comments 18 pages, 7 figures
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
Comments 8 pages, 4 figures
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)