Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment
通过噪声增强对齐的可证明防御框架对抗LLM劫持
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过噪声增强对齐的可证明防御框架,有效降低LLM劫持攻击成功率,提升模型鲁棒性与实用性。
Comments 10 pages
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
通过噪声增强对齐的可证明防御框架对抗LLM劫持
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过噪声增强对齐的可证明防御框架,有效降低LLM劫持攻击成功率,提升模型鲁棒性与实用性。
Comments 10 pages
短长度对抗训练有助于LLMs防御长长度劫持攻击:理论和实证证据
机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) ; The University of Sydney(悉尼大学) ; The University of Auckland(奥克兰大学)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.LG
AI总结 本文提出通过短长度对抗训练有效防御长长度劫持攻击,理论和实验证实了这种策略的可行性。
Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)
迈向通用且可迁移的视觉-语言模型劫持攻击
机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系) ; School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理大学计算机与信息系) ; School of Information Technology, Deakin University, Australia(德肯大学信息科技系) ; Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出UltraBreak,一种通用且可迁移的视觉-语言模型劫持攻击框架,通过视觉正则化和语义引导的文本监督,有效提升攻击的泛化能力和转移性能。
Comments ICLR 2026
通过校准劫持大语言模型
机构 * Department of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学,北京,中国)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过校准劫持大语言模型,提出一种新的聚合框架,提升攻击成功率并降低劫持成本。
SGHA-Attack:语义引导的层次对齐用于视觉-语言模型的可迁移定向攻击
机构 * Guangdong Province Key Lab of Information Security Technology, and School of Computer Science and Engineering, Sun Yat-sen University(广东信息安全技术重点实验室,计算机科学与工程学院,中山大学) ; Nanyang Technological University(南洋理工大学) ; School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(网络安全科学与技术学院,深圳校区,中山大学)
专题命中 越狱攻击 :alignment(title,abstract)
AI总结 SGHA-Attack通过语义引导的层次对齐框架,提升视觉-语言模型的定向转移攻击效果,增强跨异构模型的鲁棒性。
文本就是视觉-语言模型劫持所需
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 Text-DJ通过将文本转换为图像并诱导干扰,成功绕过视觉-语言模型的安全防护,揭示了OCR能力在面对分散多模态输入时的脆弱性。
DP-Fusion: 令牌级差分隐私推理用于大语言模型
机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德·本·泽亚德人工智能大学) ; Massachusetts Institute of Technology (MIT)(麻省理工学院)
专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 DP-Fusion通过令牌级差分隐私机制,在保证隐私的同时提升大语言模型的文本质量。
Comments Code: https://github.com/rushil-thareja/dp-fusion-lib | PyPI: https://pypi.org/project/dp-fusion-lib/ | Demo: https://www.documentprivacy.com
大卫与歌利亚:通过强化学习实现可验证的代理到代理劫持
机构 * Department of Artificial Intelligence, Radboud University, Nijmegen, The Netherlands(人工智能系,拉德堡德大学,尼姆韦根,荷兰)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
AI总结 通过强化学习框架Slingshot,验证了Tag-Along攻击作为可验证的威胁模型,并展示了如何通过环境交互从现成模型中引发有效代理攻击。
Comments Under review. 8 main pages, 2 figures, 2 tables. Appendix included
AOASS:自适应障碍感知正方形螺旋框架用于单移动锚点基于WSN定位
专题命中 越狱攻击 :safety(abstract)
AI总结 AOASS通过自适应障碍检测和优化运动模式,提升WSN中单移动锚点的定位精度与能耗效率,适用于现实物联网应用。
Comments 19 pages, 4 figures